Open-Source LLMs sind 2026 produktionsreif. Dieser Guide vergleicht die besten Modelle für lokale Deployment mit echten Benchmarks und VRAM-Anforderungen.
Schnell-Überblick
| Modell | Größe | Benchmarks | VRAM | License | Ollama? |
|---|---|---|---|---|---|
| Llama 4 | 70B | Top-Tier | 48GB | Meta | ✅ Ja |
| DeepSeek V3 | 685B (MoE) | Top-Tier | 96GB | Apache 2.0 | ✅ Ja |
| Qwen 2.5 | 7B-72B | Sehr Gut | 12-40GB | Alibaba | ✅ Ja |
| Mistral Large | 123B | Sehr Gut | 88GB | Mistral | ✅ Ja |
| Gemma 2 | 9B-27B | Gut | 12-20GB | Apache 2.0 | ✅ Ja |
| Phi-4 | 14B | Überraschend gut | 10GB | MIT | ✅ Ja |
Performance Benchmarks 2026
SWE-Bench (Code Generation) — % Resolved
DeepSeek V3 ███████████████████ 82.6%
Qwen 3.5 Ultra ███████████████░░░░ 79.8%
Mistral Large █████████████░░░░░░ 77.4%
Llama 4 70B ██████████████░░░░░░ 75.2%
Gemma 2 27B ███████████░░░░░░░░░ 72.1%
Claude 3.5 Sonnet ████████████████████ 81.2% (non open-source baseline)
Math/Reasoning (AIME 2024) — Accuracy %
DeepSeek V3 43.2%
Qwen 3.5 41.8%
Mistral Large 39.2%
Llama 4 38.5%
Gemma 2 32.1%
HumanEval (Python Coding) — Pass Rate %
DeepSeek V3 82.6%
Qwen 2.5 14B 72.5%
Llama 3.1 70B 70.1%
Mistral 7B 43.6%
Gemma 2 9B 38.2%
Detaillierter Vergleich
Llama 4 (Meta)
Verfügbarkeit: März 2026, nach Llama 3.3 Release
Größen:
- Llama 4 8B (schnell, lokal)
- Llama 4 70B (beste Balance)
- Llama 4 405B (nur große GPUs)
VRAM Anforderungen:
- 8B: 10GB (RTX 4070, RTX 3060 12GB)
- 70B: 48GB (RTX 4090 × 2, A6000)
- 405B: 200GB (nur A100/H100)
Stärken:
- Beste "ease of use" in Open-Source
- Largest Community & Ecosystem
- Ollama Support (one-click install)
- Balanced Performance across tasks
- Lizenz: Open (Meta's commercial friendly)
Schwächen:
- Nicht spezialisiert (Master of All, Expert in None)
- Qwen 2.5 ist besser bei Multilingual
- DeepSeek ist besser bei Code
Use Cases:
- Default Choice für unbekannte Tasks
- Chatbot / General Assistant
- Wenn Größe & Qualität balanced sein soll
Installation via Ollama:
ollama pull llama4:70b
ollama run llama4:70b "Explain Quantum Computing"
DeepSeek V3 (China)
Größe: 685B MoE (Mixture of Experts)
- MoE = nur ~37B Aktivations-Parameter, effizient trotz Größe
VRAM Anforderungen:
- Full Model: 96GB (benötigt 2× H100 oder 4× RTX 4090)
- Quantisiert (4-bit): 32GB (RTX 4090)
Stärken:
- "Best-in-class für Code & Math" — top leaderboard performance
- Trotz Größe relativ efficient (MoE Architecture)
- Ausgezeichnete Reasoning Capabilities
- Open License (Apache 2.0)
- Mehrsprachig (aber English-centric)
Schwächen:
- Große VRAM Anforderungen
- Relativ neu, kleinere Community als Llama
- MoE kann schwierig zu quantisieren sein
Specialization:
- Code: 82.6% HumanEval (best in class)
- Math: 43.2% AIME (best in class)
- Allgemein: 79-80% auf verschiedenen Benchmarks
Use Cases:
- Code Generation & Analysis
- Math Problem Solving
- Research / Complex Reasoning
- Wenn Qualität über Größe geht
Installation:
# Via replicate oder lokal (benötigt A100/RTX 4090×2)
ollama pull deepseek-v3:37b # quantisiert
Qwen 2.5 (Alibaba)
Größen:
- Qwen 2.5 7B
- Qwen 2.5 14B (best value)
- Qwen 2.5 32B
- Qwen 2.5 72B
Besonderheit: Beste für Multilingual (especially Asian languages)
VRAM Anforderungen:
- 7B: 8GB (RTX 3060)
- 14B: 12GB (RTX 4070, RTX 3080)
- 32B: 24GB (RTX 4090)
- 72B: 48GB (RTX 4090 + Quantization)
Stärken:
- Top für Code & Multilingual
- Excellent HumanEval (72.5% bei 14B)
- Gute Größen-Optionen (7B-72B)
- sehr gute Gemeinschaft (40M+ downloads)
- Strong für Chinesisch, Japanisch, Koreanisch
Schwächen:
- Englisch etwas schwächer als Llama
- Community kleiner als Llama global
Specialization:
- Code: Top-tier (HumanEval 72.5%)
- Multilingual: Best in class
- Größen-Vielfalt: 7B-72B
Use Cases:
- Multilingual Chats (Default für Asian Companies)
- Code Generation
- API-ready (cloud deployment)
- wenn Vielfalt in Modellgrößen wichtig
Installation:
ollama pull qwen2.5:14b
ollama run qwen2.5:14b
Mistral Large (Mistral AI)
Größe: 123B (über 400k context!)
VRAM Anforderungen:
- Quantisiert (4-bit): 40GB
- 8-bit: 88GB (RTX 4090×4)
- Full (16-bit): 250GB
Stärken:
- "400k context window" (größer als native Llama)
- 123 Sprachen Support
- Good für multilingual
- Open Weights (Mistral License)
- Excellent Instruct-tuned
Schwächen:
- Größer als beste Llama (benötigt mehr VRAM)
- SWE-Bench etwas schwächer als DeepSeek/Qwen
- Community kleiner
Specialization:
- Multilingual: Top-tier (123 Sprachen!)
- Long Context: 400k tokens (longest native)
- Code: Sehr gut aber nicht best-in-class
Use Cases:
- Multilingual Long-Context Tasks
- wenn 400k Context Window kritisch ist
- Komplexe Dokumentenanalyse (ganze Buch in einem Context!)
Gemma 2 (Google)
Größen:
- Gemma 2 9B (schnell, leicht)
- Gemma 2 27B
VRAM Anforderungen:
- 9B: 8GB
- 27B: 16-20GB
Stärken:
- Sehr kleine Models mit überraschend guter Performance
- Google-backed (Enterprise credibility)
- Gut für Edge Deployment (RPi, Phone)
- Sehr schnell (inference)
- Open License (Apache 2.0)
Schwächen:
- Nicht spezialisiert (Master of none)
- HumanEval schwächer (38.2%)
- Benchmark-Performance lags hinter Top Models
Specialization:
- Kleine Size mit guter Quality
- Edge Deployment
- Schnelle Inference
Use Cases:
- Embedded / Edge AI (Phones, IoT)
- Budget-Constraint Deployments
- wenn Geschwindigkeit > Qualität
Phi-4 (Microsoft)
Größe: 14B
VRAM: 10GB (kleinste unter Top Models!)
Stärken:
- "Surprisingly Competent für nur 14B"
- Sehr schnell
- Sehr klein (Ollama → 5GB disk)
- Gut für Prototyping
- Open (MIT License)
Schwächen:
- Noch relativ neu (März 2026)
- Benchmark-Performance unter Llama 70B
- Kleinere Community
Specialization:
- Kleine Size mit überraschender Qualität
- Schnelle Iteration / Prototyping
Use Cases:
- Rapid Prototyping
- Budget Chatbots
- wenn Größe kritisch < Qualität
VRAM Anforderungen (Übersicht)
| Modell | Größe | 4-bit Quant | 8-bit Quant | 16-bit Full |
|---|---|---|---|---|
| Phi-4 | 14B | 6GB | 9GB | 28GB |
| Qwen 2.5 | 7B | 5GB | 8GB | 16GB |
| Gemma 2 | 9B | 6GB | 9GB | 18GB |
| Llama 4 | 70B | 20GB | 40GB | 140GB |
| Mistral | 123B | 40GB | 88GB | 250GB |
| DeepSeek | 685B MoE | 32GB (37B active) | N/A | 96GB |
Praktisch:
- RTX 3060 (12GB): Phi-4, Gemma 2 9B, Qwen 2.5 7B
- RTX 4090 (24GB): Llama 4 70B (mit 4-bit quant)
- RTX 4090 × 2 (48GB): DeepSeek (quantisiert) oder Mistral (8-bit)
- H100 (80GB): Alles in voller Qualität
Ollama Vergleich
Ollama ist die easiest way zu starten mit Open-Source LLMs.
# Installation
curl https://ollama.ai/install.sh | sh
# Starte Model
ollama pull llama4:70b
ollama run llama4:70b
# API-Mode (für Entwicklung)
ollama serve
# http://localhost:11434/api/generate
Alle Top Models verfügbar in Ollama:
- llama4:70b ✅
- deepseek-v3:37b ✅ (quantisiert)
- qwen2.5:14b ✅
- mistral:latest ✅
- gemma2:latest ✅
- phi4:latest ✅
Praktische Szenarien
Szenario #1: Hobbyist mit RTX 3060
Anforderungen:
- Kleine VRAM (12GB)
- Chatbot for learning
- Free & Open
Beste Wahl: Qwen 2.5 7B
- Passt in 12GB (4-bit quantisiert = 6GB)
- Sehr gute Qualität für Größe
- Ollama one-click
Setup:
ollama pull qwen2.5:7b
ollama run qwen2.5:7b "Explain Quantum Computing"
Szenario #2: Entwickler mit RTX 4090
Anforderungen:
- Code Generation
- Große Codebase Analysis (long context)
- Self-Hosted (Privacy)
Beste Wahl: Llama 4 70B oder Mistral 123B
- Llama 4 70B: Best Balance Code + General
- Mistral 123B: Wenn 400k Context Window kritisch
Setup:
# Llama 4
ollama pull llama4:70b
# Oder
ollama pull mistral:latest
# API-Mode für IDE Integration
ollama serve
# http://localhost:11434/api/generate
Integration in VS Code via Continue.dev:
{
"models": [
{
"title": "Llama 4 70B",
"model": "llama4:70b",
"provider": "ollama",
"apiBase": "http://localhost:11434"
}
]
}
Szenario #3: Startup mit Budget für H100
Anforderungen:
- Absolut beste Qualität
- Code & Math
- Scalable API
Beste Wahl: DeepSeek V3 37B (quantisiert) oder Full Model
- Beste SWE-Bench (82.6%)
- Beste Code Generation
- Skalierbar auf GPU Cluster
Deployment (lokal):
# Via Docker + A100
docker pull deepseek/deepseek-v3
docker run -it --gpus all deepseek/deepseek-v3
Cloud Deployment (vLLM auf Runpod/Lambda):
- vLLM server für fast inference
- Multi-GPU tensor parallelism
- Per-token pricing
Szenario #4: Privacy-Critical Enterprise
Anforderungen:
- Keine externe API calls
- Sensitive Data im Model
- Compliance (GDPR)
Beste Wahl: Llama 4 70B Self-Hosted
- Meta Open License (Commercial use OK)
- Vollständige lokale Kontrolle
- Keine Data Leakage Risk
Fine-Tuning Guide (Advanced)
Alle Open-Source Models können fine-tuned werden. Llama 4 & Qwen haben beste Tooling.
# QLoRA Fine-Tuning (14B Model auf consumer GPU)
git clone https://github.com/unslothai/unsloth
cd unsloth
# Train auf deine Daten
python finetune.py \
--model_name llama4:70b \
--dataset your_data.json \
--output_dir ./lora_weights \
--lora_rank 16
Kosten:
- Fine-tuning 1B Tokens: ~$5 (Google Colab) bis $50 (A100 Cloud)
- Kein Lizenz-Cost (Open Models)
Größen-Empfehlungen nach Task
| Task | Empfohlenes Modell | Größe | VRAM |
|---|---|---|---|
| Quick Q&A | Phi-4 | 14B | 10GB |
| Code Gen | DeepSeek V3 | 37B+ | 32GB+ |
| Multilingual | Qwen 2.5 | 14B-72B | 12-40GB |
| Long Context | Mistral | 123B | 40GB |
| Edge Device | Gemma 2 | 9B | 8GB |
| Balanced | Llama 4 | 70B | 48GB |
Quantization Impact
Quantisierung reduziert VRAM, schadet aber Qualität:
Model: Llama 4 70B
VRAM Anforderung:
Unquantized (16-bit): 140GB (nur A100/H100)
8-bit (INT8): 70GB (4× RTX 4090)
4-bit (GPTQ/AWQ): 20GB (RTX 4090)
2-bit (GGUF): 10GB (RTX 3060)
Quality Loss bei 4-bit: ~2-5%
Quality Loss bei 2-bit: ~10-15%
Best Practice: 4-bit für RTX 4090 (sweet spot)
Top-5 Häufige Fehler
Problem #1: "Ollama sagt Insufficient VRAM"
- Ursache: Modell ist zu groß für deine GPU
- Lösung: Nutze quantisiertes Modell (
ollama pull model:4b) - Beispiel:
ollama pull mistral:4bstattmistral:latest
Problem #2: "DeepSeek V3 lädt nicht"
- Ursache: 685B braucht 96GB, du hast weniger
- Lösung: Nutze quantisierte Version (37B MoE aktiv)
ollama pull deepseek-v3:37b # quantisiert, ~32GB
Problem #3: "Qwen generiert auf Chinesisch für Englischen Prompt"
- Ursache: Qwen hat Bias zu Chinesisch
- Lösung: Setze explizit "Respond in English" in System Prompt
Problem #4: "Llama 4 ist langsamer als ChatGPT"
- Ursache: Local inference ist langsamer als optimierte Cloud
- Lösung: Nutze vLLM für Optimization oder Mistral für Batch Processing
Problem #5: "Fine-tuned Model ist schlechter als Base"
- Ursache: Overfitting oder schlechte Training Data
- Lösung: Nutze mehr Trainingsdaten (min. 1000 Examples) oder höheres Learning Rate
Budget nach Profil
| Profil | Modell | Hardware | Kosten |
|---|---|---|---|
| Hobby | Phi-4 / Gemma 2 | RTX 3060 (used $200) | One-time |
| Developer | Llama 4 70B | RTX 4090 ($1600) | One-time |
| Startup | DeepSeek V3 | Cloud GPU ($2-5/h) | Pay-as-use |
| Enterprise | Llama 4 / Custom Fine-tune | A100 Cluster | Custom |
Ressourcen
- Ollama Official
- Llama 4 Model Card
- DeepSeek V3 Repo
- Qwen 2.5 Hugging Face
- Mistral Official
- LM Studio (GUI für Ollama)
Letzte Aktualisierung: 21.03.2026 | Nächste Überprüfung: Juni 2026
