Open-Source LLMs sind 2026 produktionsreif. Dieser Guide vergleicht die besten Modelle für lokale Deployment mit echten Benchmarks und VRAM-Anforderungen.

Schnell-Überblick

Modell Größe Benchmarks VRAM License Ollama?
Llama 4 70B Top-Tier 48GB Meta ✅ Ja
DeepSeek V3 685B (MoE) Top-Tier 96GB Apache 2.0 ✅ Ja
Qwen 2.5 7B-72B Sehr Gut 12-40GB Alibaba ✅ Ja
Mistral Large 123B Sehr Gut 88GB Mistral ✅ Ja
Gemma 2 9B-27B Gut 12-20GB Apache 2.0 ✅ Ja
Phi-4 14B Überraschend gut 10GB MIT ✅ Ja

Performance Benchmarks 2026

SWE-Bench (Code Generation) — % Resolved

DeepSeek V3        ███████████████████ 82.6%
Qwen 3.5 Ultra     ███████████████░░░░ 79.8%
Mistral Large      █████████████░░░░░░ 77.4%
Llama 4 70B        ██████████████░░░░░░ 75.2%
Gemma 2 27B        ███████████░░░░░░░░░ 72.1%
Claude 3.5 Sonnet  ████████████████████ 81.2% (non open-source baseline)

Math/Reasoning (AIME 2024) — Accuracy %

DeepSeek V3        43.2%
Qwen 3.5           41.8%
Mistral Large      39.2%
Llama 4            38.5%
Gemma 2            32.1%

HumanEval (Python Coding) — Pass Rate %

DeepSeek V3        82.6%
Qwen 2.5 14B       72.5%
Llama 3.1 70B      70.1%
Mistral 7B         43.6%
Gemma 2 9B         38.2%

Detaillierter Vergleich

Llama 4 (Meta)

Verfügbarkeit: März 2026, nach Llama 3.3 Release

Größen:

  • Llama 4 8B (schnell, lokal)
  • Llama 4 70B (beste Balance)
  • Llama 4 405B (nur große GPUs)

VRAM Anforderungen:

  • 8B: 10GB (RTX 4070, RTX 3060 12GB)
  • 70B: 48GB (RTX 4090 × 2, A6000)
  • 405B: 200GB (nur A100/H100)

Stärken:

  • Beste "ease of use" in Open-Source
  • Largest Community & Ecosystem
  • Ollama Support (one-click install)
  • Balanced Performance across tasks
  • Lizenz: Open (Meta's commercial friendly)

Schwächen:

  • Nicht spezialisiert (Master of All, Expert in None)
  • Qwen 2.5 ist besser bei Multilingual
  • DeepSeek ist besser bei Code

Use Cases:

  • Default Choice für unbekannte Tasks
  • Chatbot / General Assistant
  • Wenn Größe & Qualität balanced sein soll

Installation via Ollama:

ollama pull llama4:70b
ollama run llama4:70b "Explain Quantum Computing"

DeepSeek V3 (China)

Größe: 685B MoE (Mixture of Experts)

  • MoE = nur ~37B Aktivations-Parameter, effizient trotz Größe

VRAM Anforderungen:

  • Full Model: 96GB (benötigt 2× H100 oder 4× RTX 4090)
  • Quantisiert (4-bit): 32GB (RTX 4090)

Stärken:

  • "Best-in-class für Code & Math" — top leaderboard performance
  • Trotz Größe relativ efficient (MoE Architecture)
  • Ausgezeichnete Reasoning Capabilities
  • Open License (Apache 2.0)
  • Mehrsprachig (aber English-centric)

Schwächen:

  • Große VRAM Anforderungen
  • Relativ neu, kleinere Community als Llama
  • MoE kann schwierig zu quantisieren sein

Specialization:

  • Code: 82.6% HumanEval (best in class)
  • Math: 43.2% AIME (best in class)
  • Allgemein: 79-80% auf verschiedenen Benchmarks

Use Cases:

  • Code Generation & Analysis
  • Math Problem Solving
  • Research / Complex Reasoning
  • Wenn Qualität über Größe geht

Installation:

# Via replicate oder lokal (benötigt A100/RTX 4090×2)
ollama pull deepseek-v3:37b  # quantisiert

Qwen 2.5 (Alibaba)

Größen:

  • Qwen 2.5 7B
  • Qwen 2.5 14B (best value)
  • Qwen 2.5 32B
  • Qwen 2.5 72B

Besonderheit: Beste für Multilingual (especially Asian languages)

VRAM Anforderungen:

  • 7B: 8GB (RTX 3060)
  • 14B: 12GB (RTX 4070, RTX 3080)
  • 32B: 24GB (RTX 4090)
  • 72B: 48GB (RTX 4090 + Quantization)

Stärken:

  • Top für Code & Multilingual
  • Excellent HumanEval (72.5% bei 14B)
  • Gute Größen-Optionen (7B-72B)
  • sehr gute Gemeinschaft (40M+ downloads)
  • Strong für Chinesisch, Japanisch, Koreanisch

Schwächen:

  • Englisch etwas schwächer als Llama
  • Community kleiner als Llama global

Specialization:

  • Code: Top-tier (HumanEval 72.5%)
  • Multilingual: Best in class
  • Größen-Vielfalt: 7B-72B

Use Cases:

  • Multilingual Chats (Default für Asian Companies)
  • Code Generation
  • API-ready (cloud deployment)
  • wenn Vielfalt in Modellgrößen wichtig

Installation:

ollama pull qwen2.5:14b
ollama run qwen2.5:14b

Mistral Large (Mistral AI)

Größe: 123B (über 400k context!)

VRAM Anforderungen:

  • Quantisiert (4-bit): 40GB
  • 8-bit: 88GB (RTX 4090×4)
  • Full (16-bit): 250GB

Stärken:

  • "400k context window" (größer als native Llama)
  • 123 Sprachen Support
  • Good für multilingual
  • Open Weights (Mistral License)
  • Excellent Instruct-tuned

Schwächen:

  • Größer als beste Llama (benötigt mehr VRAM)
  • SWE-Bench etwas schwächer als DeepSeek/Qwen
  • Community kleiner

Specialization:

  • Multilingual: Top-tier (123 Sprachen!)
  • Long Context: 400k tokens (longest native)
  • Code: Sehr gut aber nicht best-in-class

Use Cases:

  • Multilingual Long-Context Tasks
  • wenn 400k Context Window kritisch ist
  • Komplexe Dokumentenanalyse (ganze Buch in einem Context!)

Gemma 2 (Google)

Größen:

  • Gemma 2 9B (schnell, leicht)
  • Gemma 2 27B

VRAM Anforderungen:

  • 9B: 8GB
  • 27B: 16-20GB

Stärken:

  • Sehr kleine Models mit überraschend guter Performance
  • Google-backed (Enterprise credibility)
  • Gut für Edge Deployment (RPi, Phone)
  • Sehr schnell (inference)
  • Open License (Apache 2.0)

Schwächen:

  • Nicht spezialisiert (Master of none)
  • HumanEval schwächer (38.2%)
  • Benchmark-Performance lags hinter Top Models

Specialization:

  • Kleine Size mit guter Quality
  • Edge Deployment
  • Schnelle Inference

Use Cases:

  • Embedded / Edge AI (Phones, IoT)
  • Budget-Constraint Deployments
  • wenn Geschwindigkeit > Qualität

Phi-4 (Microsoft)

Größe: 14B

VRAM: 10GB (kleinste unter Top Models!)

Stärken:

  • "Surprisingly Competent für nur 14B"
  • Sehr schnell
  • Sehr klein (Ollama → 5GB disk)
  • Gut für Prototyping
  • Open (MIT License)

Schwächen:

  • Noch relativ neu (März 2026)
  • Benchmark-Performance unter Llama 70B
  • Kleinere Community

Specialization:

  • Kleine Size mit überraschender Qualität
  • Schnelle Iteration / Prototyping

Use Cases:

  • Rapid Prototyping
  • Budget Chatbots
  • wenn Größe kritisch < Qualität

VRAM Anforderungen (Übersicht)

Modell Größe 4-bit Quant 8-bit Quant 16-bit Full
Phi-4 14B 6GB 9GB 28GB
Qwen 2.5 7B 5GB 8GB 16GB
Gemma 2 9B 6GB 9GB 18GB
Llama 4 70B 20GB 40GB 140GB
Mistral 123B 40GB 88GB 250GB
DeepSeek 685B MoE 32GB (37B active) N/A 96GB

Praktisch:

  • RTX 3060 (12GB): Phi-4, Gemma 2 9B, Qwen 2.5 7B
  • RTX 4090 (24GB): Llama 4 70B (mit 4-bit quant)
  • RTX 4090 × 2 (48GB): DeepSeek (quantisiert) oder Mistral (8-bit)
  • H100 (80GB): Alles in voller Qualität

Ollama Vergleich

Ollama ist die easiest way zu starten mit Open-Source LLMs.

# Installation
curl https://ollama.ai/install.sh | sh

# Starte Model
ollama pull llama4:70b
ollama run llama4:70b

# API-Mode (für Entwicklung)
ollama serve
# http://localhost:11434/api/generate

Alle Top Models verfügbar in Ollama:

  • llama4:70b ✅
  • deepseek-v3:37b ✅ (quantisiert)
  • qwen2.5:14b ✅
  • mistral:latest ✅
  • gemma2:latest ✅
  • phi4:latest ✅

Praktische Szenarien

Szenario #1: Hobbyist mit RTX 3060

Anforderungen:

  • Kleine VRAM (12GB)
  • Chatbot for learning
  • Free & Open

Beste Wahl: Qwen 2.5 7B

  • Passt in 12GB (4-bit quantisiert = 6GB)
  • Sehr gute Qualität für Größe
  • Ollama one-click

Setup:

ollama pull qwen2.5:7b
ollama run qwen2.5:7b "Explain Quantum Computing"

Szenario #2: Entwickler mit RTX 4090

Anforderungen:

  • Code Generation
  • Große Codebase Analysis (long context)
  • Self-Hosted (Privacy)

Beste Wahl: Llama 4 70B oder Mistral 123B

  • Llama 4 70B: Best Balance Code + General
  • Mistral 123B: Wenn 400k Context Window kritisch

Setup:

# Llama 4
ollama pull llama4:70b
# Oder
ollama pull mistral:latest

# API-Mode für IDE Integration
ollama serve
# http://localhost:11434/api/generate

Integration in VS Code via Continue.dev:

{
  "models": [
    {
      "title": "Llama 4 70B",
      "model": "llama4:70b",
      "provider": "ollama",
      "apiBase": "http://localhost:11434"
    }
  ]
}

Szenario #3: Startup mit Budget für H100

Anforderungen:

  • Absolut beste Qualität
  • Code & Math
  • Scalable API

Beste Wahl: DeepSeek V3 37B (quantisiert) oder Full Model

  • Beste SWE-Bench (82.6%)
  • Beste Code Generation
  • Skalierbar auf GPU Cluster

Deployment (lokal):

# Via Docker + A100
docker pull deepseek/deepseek-v3
docker run -it --gpus all deepseek/deepseek-v3

Cloud Deployment (vLLM auf Runpod/Lambda):

  • vLLM server für fast inference
  • Multi-GPU tensor parallelism
  • Per-token pricing

Szenario #4: Privacy-Critical Enterprise

Anforderungen:

  • Keine externe API calls
  • Sensitive Data im Model
  • Compliance (GDPR)

Beste Wahl: Llama 4 70B Self-Hosted

  • Meta Open License (Commercial use OK)
  • Vollständige lokale Kontrolle
  • Keine Data Leakage Risk

Fine-Tuning Guide (Advanced)

Alle Open-Source Models können fine-tuned werden. Llama 4 & Qwen haben beste Tooling.

# QLoRA Fine-Tuning (14B Model auf consumer GPU)
git clone https://github.com/unslothai/unsloth
cd unsloth

# Train auf deine Daten
python finetune.py \
  --model_name llama4:70b \
  --dataset your_data.json \
  --output_dir ./lora_weights \
  --lora_rank 16

Kosten:

  • Fine-tuning 1B Tokens: ~$5 (Google Colab) bis $50 (A100 Cloud)
  • Kein Lizenz-Cost (Open Models)

Größen-Empfehlungen nach Task

Task Empfohlenes Modell Größe VRAM
Quick Q&A Phi-4 14B 10GB
Code Gen DeepSeek V3 37B+ 32GB+
Multilingual Qwen 2.5 14B-72B 12-40GB
Long Context Mistral 123B 40GB
Edge Device Gemma 2 9B 8GB
Balanced Llama 4 70B 48GB

Quantization Impact

Quantisierung reduziert VRAM, schadet aber Qualität:

Model: Llama 4 70B
VRAM Anforderung:

Unquantized (16-bit):    140GB (nur A100/H100)
8-bit (INT8):            70GB (4× RTX 4090)
4-bit (GPTQ/AWQ):        20GB (RTX 4090)
2-bit (GGUF):            10GB (RTX 3060)

Quality Loss bei 4-bit: ~2-5%
Quality Loss bei 2-bit: ~10-15%

Best Practice: 4-bit für RTX 4090 (sweet spot)

Top-5 Häufige Fehler

Problem #1: "Ollama sagt Insufficient VRAM"

  • Ursache: Modell ist zu groß für deine GPU
  • Lösung: Nutze quantisiertes Modell (ollama pull model:4b)
  • Beispiel: ollama pull mistral:4b statt mistral:latest

Problem #2: "DeepSeek V3 lädt nicht"

  • Ursache: 685B braucht 96GB, du hast weniger
  • Lösung: Nutze quantisierte Version (37B MoE aktiv)
ollama pull deepseek-v3:37b  # quantisiert, ~32GB

Problem #3: "Qwen generiert auf Chinesisch für Englischen Prompt"

  • Ursache: Qwen hat Bias zu Chinesisch
  • Lösung: Setze explizit "Respond in English" in System Prompt

Problem #4: "Llama 4 ist langsamer als ChatGPT"

  • Ursache: Local inference ist langsamer als optimierte Cloud
  • Lösung: Nutze vLLM für Optimization oder Mistral für Batch Processing

Problem #5: "Fine-tuned Model ist schlechter als Base"

  • Ursache: Overfitting oder schlechte Training Data
  • Lösung: Nutze mehr Trainingsdaten (min. 1000 Examples) oder höheres Learning Rate

Budget nach Profil

Profil Modell Hardware Kosten
Hobby Phi-4 / Gemma 2 RTX 3060 (used $200) One-time
Developer Llama 4 70B RTX 4090 ($1600) One-time
Startup DeepSeek V3 Cloud GPU ($2-5/h) Pay-as-use
Enterprise Llama 4 / Custom Fine-tune A100 Cluster Custom

Ressourcen

Letzte Aktualisierung: 21.03.2026 | Nächste Überprüfung: Juni 2026