Die Landschaft der großen Sprachmodelle hat sich 2026 stabilisiert: Cloud-APIs für hohe Qualität und Performance, lokale Open-Source-Modelle für Datenschutz und Kostenoptimierung.
Cloud-APIs im Vergleich
Claude (Anthropic) — Best for Complex Reasoning
| Modell | Input | Output | Context | Stärken |
|---|---|---|---|---|
| Opus 4.6 | $5/1M | $25/1M | 200K | Bestes Reasoning, lange Dokumente |
| Sonnet 4.6 | $3/1M | $15/1M | 200K | Balance Qualität + Speed |
| Haiku 4.5 | $0.80/1M | $4/1M | 200K | Schnell, billig |
Warum Claude:
- Keine Weiterverarbeitung zum Training
- Constitutional AI (transparent)
- 200K Context (doppelt so lang wie ChatGPT)
- Besser bei Code und komplexen Analysen
DSGVO: Daten gehen an Anthropic (USA), aber mit DPA-Optionen.
OpenAI GPT — Broad Capability
| Modell | Input | Output | Context | Stärken |
|---|---|---|---|---|
| GPT-5 | $3/1M | $12/1M | 128K | Neuester Stand, beste Codequality |
| GPT-4.1 | $2/1M | $8/1M | 1M | Production-Standard |
| GPT-4o | $2.50/1M | $10/1M | 128K | Multimodal (Video, Audio) |
| o3 (Reasoning) | $2-8/1M | — | 128K | Mathematik, Logik, Beweise |
Warum ChatGPT:
- Größtes Ökosystem (Plugins, Integrationen)
- Multimodal native
- Reasoning Models für spezialisierte Aufgaben
- Schneller als Claude bei vielen Tasks
DSGVO: USA-Verarbeitung, komplexere DPA-Anforderungen.
Google Gemini — Long Context, Billig
| Modell | Input | Output | Context | Stärken |
|---|---|---|---|---|
| Gemini 2.0 Advanced | $3/1M | $12/1M | 1M | Lang, multimodal |
| Gemini 2.0 Flash | $0.075/1M | $0.30/1M | 1M | Sehr billig, schnell |
Warum Gemini:
- 1M Context (längst aller)
- Billigster High-Quality Modell
- Gutes Multimodal (besser als Claude)
- Integriert mit Google Services
DSGVO: Google USA-basiert, ähnliche Probleme wie OpenAI.
Lokale Modelle — Die wichtigsten
Llama 3.1 8B und Llama 3.3 70B (Meta)
| Größe | VRAM | Speed | Best For |
|---|---|---|---|
| 8B (Llama 3.1) | 16GB | 20 tok/s | Desktop, billig |
| 70B (Llama 3.3) | 48GB | 3 tok/s | Workstation |
Praktisch:
- Stabilste 8B für produktive Nutzung
- Gutes Deutsch-Support
- Kostenlos, Open Weights
ollama run llama2:70b
Hardware-Beispiel:
- MacBook Air M3: 8B möglich (16GB unified RAM)
- RTX 4070: 70B @ 50% Quality
- RTX 4090: 70B @ 100% Quality
Qwen 2.5 (Alibaba) — Best für Code
| Größe | VRAM | Speed | Best For |
|---|---|---|---|
| 7B Coder | 16GB | 25 tok/s | Code-Assistenz |
| 14B Coder | 28GB | 12 tok/s | Komplexer Code |
| 32B | 64GB | 5 tok/s | Strategisch |
Vorteile:
- Beste lokale Code-Qualität
- Multilingual (Chinesisch + Deutsch + English)
- Schneller als Llama
- Perfekt für Private Code-Assistenz
Setup:
ollama run qwen2.5-coder:7b
# Modell: 8GB (~4GB nutzbar)
# Bei RTX 4070: ~25 tokens/sec
Mistral 7B — Speed Champion
| Größe | VRAM | Speed | Tokens/sec |
|---|---|---|---|
| 7B | 16GB | ~40 tok/s | Schnellster 7B |
| 8x7B MoE | 60GB | ~35 tok/s | Höhere Qualität |
Warum Mistral:
- Schnellste Inference
- Kleines VRAM-Footprint
- Good für Real-Time (Chat, API)
- Französischer Provider (EU Consideration)
DeepSeek R1 — Best Reasoning (2026)
| Größe | VRAM | Reasoning Quality |
|---|---|---|
| 14B | 28GB | 80% of o3 |
| 70B | 140GB | 90% of o3 |
Besonderheit:
- Explizites Reasoning wie o3
- Kostenlos und Open Source
- Beste Alternative zu OpenAI Reasoning
- Für mathematische/logische Probleme
Schnell: ollama run deepseek-r1:14b
Gemma 2 (Google) — Lean
| Größe | VRAM | Best For |
|---|---|---|
| 2B | 4GB | Mobile, Edge |
| 9B | 18GB | Compact Production |
Use: Wenn extremer Speicher-Druck (z.B. älteren Hardware oder Cloud-Functions).
VRAM-Anforderungen Tabelle
Unter 8GB RAM
- Phi-3.5 3.8B: ✅ Passt knapp
- Qwen 2.5 7B Q4: ~6GB (tight)
- Hardware: MacBook Air M3, Laptop RTX 4050
8-16GB RAM
- Llama 3.1 8B: ✅ Ideal
- Mistral 7B: ✅ Ideal
- Qwen 2.5 14B Q4: 12GB (knapp)
- Hardware: RTX 4070, Mac Studio, Gaming-Laptop
16-24GB RAM
- Llama 70B (Q4): 18GB OK
- Gemma 2 27B: 20GB OK
- Qwen 32B Q4: 24GB knapp
- Hardware: RTX 4090, High-End Workstation
24GB+
- Alles läuft
- Mehrere Modelle parallel möglich
- Hardware: RTX 6000 Ada, H100 (Production)
Quantisierung erklärt
Modelle im Original (FP32):
- Llama 70B FP32 = 280GB (unmöglich)
- Llama 70B BF16 = 140GB (immer noch zu gross)
Quantisierung reduziert die Größe:
| Format | Größe vs Original | Qualität | Speed |
|---|---|---|---|
| Q5_K_M | 70% | 99% | Kaum langsamer |
| Q4_K_M | 50% | 95% | 5-10% langsamer |
| Q3_K_M | 35% | 85% | 15% langsamer |
Standard: Q4_K_M (50% Größe, 95% Qualität) ist der beste Trade-off.
Praxis-Beispiel:
# Llama 70B mit Q4_K_M Quantisierung
# Original: 140GB
# Quantisiert: 35-40GB auf RTX 4090
# Speed: 3-4 tokens/second
Cloud vs. Self-Hosted: Die Entscheidung
Cloud-APIs
Pro:
- ✅ Keine Hardware-Anschaffung
- ✅ Neueste Modelle sofort
- ✅ Skalierbar (wenig Overhead)
- ✅ Professional Support
Con:
- ❌ Laufende Kosten (€1-10k/Monat at scale)
- ❌ Daten gehen zu Dritten
- ❌ Abhängig von Internet
Kostenbeispiel (1M Anfragen/Jahr):
- Claude Sonnet: €6.000/Jahr
- GPT-5: €3.000/Jahr
- Google Gemini Flash: €500/Jahr
Self-Hosted Lokal
Pro:
- ✅ €0 laufende Kosten (nur Strom)
- ✅ Daten bleiben lokal (GDPR)
- ✅ Unbegrenzte Nutzung
- ✅ Vollständige Kontrolle
Con:
- ❌ Hardware-Anschaffung (€2k-20k einmalig)
- ❌ Wartung (1h/Monat)
- ❌ Ältere Modelle (Q3/Q4 2025 vs. aktuell)
- ❌ Etwas langsamer als Cloud
Break-Even:
- Bei > 10k Anfragen/Tag oder > €5k/Jahr Cloud-Kosten → Self-Hosted wirtschaftlich
Benchmark-Vergleich 2026
| Aufgabe | Claude | GPT | Llama 70B | Qwen 32B | DeepSeek R1 |
|---|---|---|---|---|---|
| HumanEval (Code) | 92% | 94% | 85% | 87% | 88% |
| MMLU (Knowledge) | 88% | 89% | 78% | 82% | 84% |
| Reasoning (ARC) | 85% | 87% | 75% | 80% | 86% |
| Hallucination Rate | 3.2% | 5.1% | 8% | 7% | 4.2% |
Fazit: Cloud-Modelle sind 5-10% besser, aber lokale Modelle sind nah dran.
Fallstudien: Wann welches Modell?
Use-Case 1: Kundensupport-Chatbot
Anforderung: Schnell, billig, kontinuierlich verfügbar
Cloud: GPT-4o oder Sonnet (€5-10k/Monat bei Volumen)
Local: Llama 3.1 8B auf RTX 4070 (€20/Monat Server, unbegrenzt)
Winner: Lokal (50x günstiger)
Use-Case 2: Code-Assistent (Entwickler)
Anforderung: Beste Code-Qualität, lokal, schnell
Cloud: Qwen 2.5 Coder API oder Claude Sonnet (€50-200/Monat)
Local: Qwen 2.5 7B Coder auf RTX 4070 (€0/Monat nach Hardware)
Winner: Lokal (bessere Qualität + kostenlos)
Use-Case 3: DSGVO-sensitive Kundendaten
Anforderung: Daten dürfen nicht zu Cloud, aber gute Qualität nötig
Cloud: Nicht möglich (Datenschutz-Risiko)
Local: Llama 3.3 70B oder Claude lokal (mit Edge-Deployment)
Winner: Lokal (einzige Option)
Use-Case 4: Schnelle Ad-hoc Analysen
Anforderung: Schnell verfügbar, hohe Qualität, beliebig nutzbar
Cloud: Claude Opus oder ChatGPT-5 (€0.005-0.15 pro Anfrage)
Local: Keine praktische Alternative
Winner: Cloud (sofort verfügbar, keine Wartung)
Empfehlungsmatrix nach Budget
| Monatliches Budget | Best Practice |
|---|---|
| €0 | Ollama Llama 8B (Hardware-Voraussetzung: RTX 4070+) |
| €0-50 | n8n Cloud Free + lokale Modelle für Production |
| €50-200 | Cloud-APIs für Backup, lokal für Primary |
| €200-500 | Hybrid: Claude + GPT, lokal für sensitive Data |
| €500+ | Vollständige Cloud-Suite + lokale Redundanz |
Installation: 5 Minuten Setup
Ollama (Einfachste Methode)
# Download https://ollama.ai
ollama run llama2:70b
# Browser: http://localhost:11434
# API verfügbar für Integration
n8n + lokales Modell
# docker-compose.yml
services:
n8n:
image: n8nio/n8n
environment:
- OLLAMA_API_BASE=http://ollama:11434
ollama:
image: ollama/ollama
volumes:
- ollama_data:/root/.ollama
Dann in n8n: "Ollama" Node mit llama2:70b Model.
Checkliste: Dein perfektes Modell
-
Daten-Sensibilität: GDPR-relevant?
- Ja → Lokal zwingend
- Nein → Cloud OK
-
Volumen: Anfragen/Tag?
- < 100 → Cloud (einfach)
- 100-1000 → Hybrid (Cloud + Backup lokal)
-
1000 → Lokal (wirtschaftlich)
-
Qualität nötig? Code, Reasoning?
- Höchste Qualität → Claude Opus
- Gute Balance → Sonnet oder Qwen 32B
- Schnell & billig → Gemini Flash oder Mistral
-
Hardware verfügbar?
- RTX 4070+ → Lokal mit 70B Modellen
- RTX 4060 → Lokal mit 7B Modellen
- Kein GPU → Cloud nur
-
Finales Urteil:
- Gutes Deutsch + Code → Qwen lokal
- Beste Qualität egal Kosten → Claude Opus Cloud
- Budget-freundlich → Gemini Flash Cloud
- Datenschutz Pflicht → Llama 70B lokal
Unsere Empfehlung für KMUs 2026: Start mit Ollama + Llama 8B lokal (kostenlos nach Hardware). Als Backup: Claude API für wenn Qualität kritisch ist.
