Lokale LLMs mit Ollama geben dir volle Datenkontrolle und unbegrenzte Nutzung. Cloud-LLMs sind einfacher, aber teuer bei hohem Volumen. Hier ist der vollständige Vergleich.
Hardware-Anforderungen für Ollama
Die größte Hürde ist: Welche GPU/CPU braucht dein Modell?
GPU Memory nach Modell-Größe
| Modellgröße | Parameter | VRAM nötig | Quantization | Qualität |
|---|---|---|---|---|
| Tiny | 100M-2B | 2-4GB | Q4_K_M | Gut für Chat |
| Small | 2B-10B | 6-16GB | Q4_K_M | Ausgezeichnet |
| Medium | 10B-20B | 16-24GB | Q4_K_M | Sehr gut |
| Large | 20B-70B | 24-48GB | Q4_K_M | Near-GPT-3.5 |
| Very Large | 70B-110B | 80GB+ | Q4_K_M | GPT-4 Nähe |
Quantization-Trick: Q4_K_M (4-bit Quantization) reduziert VRAM um ~75% ohne großen Qualitätsverlust. Ein 7B-Modell in FP16 (14GB) wird in Q4_K_M (~3.5GB).
Praktische GPU-Optionen
| GPU | VRAM | Preis | Tokens/sec | Best For |
|---|---|---|---|---|
| RTX 3060 | 12GB | $250-300 | 15 | Llama 3 8B |
| RTX 4070 | 12GB | $400-500 | 25 | Mistral 7B + Llama 13B |
| RTX 4090 | 24GB | $1200-1500 | 60 | Llama 70B, Mixtral |
| A100 | 40GB | $5000+ | 100+ | Production, Multi-Tenant |
| H100 | 80GB | $15000+ | 200+ | Training, Enterprise |
Sweet Spot für KMUs: RTX 4070 oder RTX 4080 (12-16GB VRAM). Kostet ~$400-600, läuft alles bis Llama 13B locker.
RAM und CPU-Anforderungen
- System RAM: 1.5x der Modellgröße (für Llama 7B: 12GB Modell = 18GB RAM empfohlen)
- CPU: 8-Kern genügt für Inference. Training braucht mehr.
- Storage: 50-100GB Puffer für Modelle und Datenbank
Break-Even: Einmalige Kosten
| Setup | GPU | RAM | Storage | CPU | Total | Stromkosten/Jahr |
|---|---|---|---|---|---|---|
| Budget | RTX 3060 ($250) | 32GB RAM ($80) | 256GB SSD ($30) | Ryzen 5600 ($150) | ~$700 | $50 |
| Mid-Range | RTX 4070 ($450) | 64GB RAM ($200) | 512GB SSD ($50) | Ryzen 7600 ($300) | ~$1.500 | $105 |
| High-End | RTX 4090 ($1.500) | 128GB RAM ($500) | 1TB SSD ($100) | Intel i9 ($500) | ~$3.500 | $200 |
Stromkosten: ~700-1000W durchschnittlich, $0.15 pro kWh = ~$100-150/Jahr.
Cloud LLM Kosten im Vergleich
Claude (Anthropic)
- Sonnet 4.6: $3 Input / $15 Output pro 1M Tokens
- Opus 4.6: $5 Input / $25 Output pro 1M Tokens
ChatGPT / OpenAI
- GPT-5: $1.25 Input / $10 Output pro 1M Tokens
- GPT-4.1: $2 Input / $8 Output pro 1M Tokens
- GPT-4o: $2.50 Input / $10 Output pro 1M Tokens
Google Gemini
- Gemini 1.5 Pro: $2.50 Input / $7.50 Output pro 1M Tokens
Ollama (Self-Hosted)
- Stromkosten + Hardware-Amortisation
Break-Even Analyse: Wann lohnt sich Ollama?
Szenario: Content Writer, 25M Tokens/Monat
Cloud-Kosten (Claude Sonnet 4.6):
- 20M Input @ $3 = $60
- 5M Output @ $15 = $75
- Total: $135/Monat = $1.620/Jahr
Ollama (Mid-Range, $1.500):
- Hardware-Amortisation: $1.500 / 3 Jahre = $500/Jahr
- Stromkosten: $105/Jahr
- Total: $605/Jahr
Break-Even: 2.5 Jahre mit dieser Hardware. Ab Jahr 3 sparst du $1.015/Jahr.
Szenario: Kleine Firma, 100M Tokens/Monat
Cloud-Kosten (GPT-4.1):
- 80M Input @ $2 = $160
- 20M Output @ $8 = $160
- Total: $320/Monat = $3.840/Jahr
Ollama (Mid-Range, $1.500):
- Hardware-Amortisation: $500/Jahr
- Stromkosten: $105/Jahr
- Total: $605/Jahr
Break-Even: 5-6 Monate. Dann spart du $3.235/Jahr.
Szenario: Multi-Team, 500M+ Tokens/Monat
Cloud-Kosten (GPT-5):
- 400M Input @ $1.25 = $500
- 100M Output @ $10 = $1.000
- Total: $1.500/Monat = $18.000/Jahr
Ollama (Enterprise, 2 x RTX 4090, $7.000):
- Hardware-Amortisation: $2.333/Jahr
- Stromkosten: $400/Jahr
- Total: $2.733/Jahr
Ersparnis: $15.267/Jahr. ROI in 5 Monaten.
Fazit:
- Unter 10M Tokens/Monat → Cloud ist billiger (einfacher Setup)
- 10-50M Tokens/Monat → Ollama break-even in 1-2 Jahren
- Über 50M Tokens/Monat → Ollama ist sofort günstiger
Modell-Qualität: Lokal vs. Cloud
Nach Task-Typ
| Task | Beste Local | Beste Cloud | Winner |
|---|---|---|---|
| Code-Generierung | Llama 3 8B | GPT-4 / Opus 4.6 | Cloud (10% besser) |
| Dokumentation/Blogs | Mistral 7B | Claude Sonnet 4.6 | Cloud (15% besser) |
| Datenanalyse | Qwen 2.5 14B | GPT-4.1 | Cloud (20% besser) |
| Logik/Reasoning | - | OpenAI o3 | Cloud (nur cloud verfügbar) |
| Allgemeiner Chat | Llama 3 70B | Opus 4.6 | Cloud (5% besser) |
| Summarization | Llama 3 8B | Sonnet 4.6 | Praktisch gleich |
| Übersetzung | mBART | Claude Sonnet | Cloud (10% besser) |
| Zensurfreier Output | Alle lokal | - | Lokal (nur lokal) |
Resultat: Cloud-Modelle sind in Qualität 5-20% besser, aber lokale Modelle sind "gut genug" für 80% der Fälle.
Ollama Praktischer Setup (in 5 Minuten)
Installation
# macOS / Linux
curl https://ollama.ai/install.sh | sh
# oder Docker
docker run -d -v ollama:/root/.ollama -p 11434:11434 ollama/ollama
Modell laden
# Llama 3 8B (4.7GB, Q4_K_M) — Standard
ollama pull llama3:8b
# Mistral 7B (4.1GB) — Schnell und gut
ollama pull mistral:latest
# Qwen 2.5 32B (19GB) — wenn du 24GB+ VRAM hast
ollama pull qwen2.5:32b
API-Zugriff
# Ollama läuft auf http://localhost:11434
curl http://localhost:11434/api/generate -d '{
"model": "llama3:8b",
"prompt": "Was ist DSGVO?"
}'
In deiner App nutzen
import requests
import json
url = "http://localhost:11434/api/generate"
data = {
"model": "llama3:8b",
"prompt": "Schreib eine Produktbeschreibung für eine Cloud-API",
"stream": False
}
response = requests.post(url, json=data)
result = json.loads(response.text)
print(result["response"])
Performance: Tokens per Sekunde
| Modell | GPU | Tokens/sec | Latency |
|---|---|---|---|
| Llama 3 8B | RTX 4070 | 25 | 40ms |
| Mistral 7B | RTX 4070 | 30 | 33ms |
| Llama 3 70B | RTX 4090 | 50 | 20ms |
| Claude Sonnet API | Cloud | ~10 | 500-2000ms |
Achtung: Cloud-APIs haben höhere Latenz wegen Netzwerk. Ollama lokal ist 10-100x schneller.
Hybrid-Ansatz: Best of Both
┌─────────────────────────────────┐
│ Deine Anwendung │
├─────────────────────────────────┤
│ Lokal (Ollama) │
│ - Schnelle Tasks (Chat, Summa) │
│ - Interne Docs │
│ - Datenschutz-sensitiv │
└────────────┬──────────────────────
│
│ Cloud (Claude/GPT) │
│ - Code-Review & Generation │
│ - Komplexe Reasoning Tasks │
│ - Multimodal (Bilder) │
└─────────────────────────────────┘
Umsetzung:
- Standard-Prompts → Ollama (lokal, schnell, kostenlos)
- Komplexe Tasks → Cloud-API (wenn Qualität wichtig ist)
- Routing per Cost-Benefit (lokal zuerst, fallback zu Cloud)
DSGVO & Datenschutz
Ollama (Self-Hosted)
✅ Vollständig DSGVO-konform
- Keine Daten verlässt deinen Server
- Keine Datenbearbeitung durch Dritte
- Du bist der Daten-Processor
Cloud LLMs
⚠️ Komplex, braucht Vorsicht
- Claude: Verarbeitet deine Eingaben, speichert nicht zum Training
- OpenAI: Speichert API-Requests log-weise, nicht zum Training
- Google: Ähnlich wie OpenAI
- Wichtig: DPA mit dem Provider ist erforderlich
Für sensitive Daten (Kundendaten, Finanzen, Medizin): Ollama immer. Cloud nur mit expliziter DPA.
Wann welcher Ansatz?
Nutze Ollama (Lokal), wenn…
- Datenschutz / DSGVO kritisch ist
- Du über 50M Tokens/Monat brauchst
- Du zensurfreien Output brauchst (keine Content-Filter)
- Dein Team Tech-Skills hat
- Du volle Kontrolle haben willst
Nutze Cloud (Claude/OpenAI), wenn…
- Du schnell starten willst (kein Hardware-Setup)
- Du unter 10M Tokens/Monat brauchst
- Du Multimodal-Input brauchst (Bilder, Audio)
- Du Reasoning-Tasks brauchst (o3 etc.)
- Dein Budget flexibel ist
Nutze Hybrid, wenn…
- Du großes Volumen mit Mixed-Sensitivity brauchst
- Dein Team beides maintainen kann
- Kosten-Optimierung + Qualität beide wichtig
Checkliste
- Hast du eine GPU mit 12GB+ VRAM oder willst eine kaufen? → Ollama möglich
- Sind deine Daten datenschutz-sensitiv? → Ollama oder DPA-gesicherte Cloud
- Brauchst du Multimodal (Bilder, Audio, Video)? → Cloud-LLMs
- Ist dein Volumen >50M Tokens/Monat? → Ollama ist günstiger
- Brauchst du höchste Qualität (Code, Reasoning)? → Cloud > Ollama
- Hast du weniger als 5M Tokens/Monat? → Cloud ist einfacher + günstiger
Österreich-spezifische DSGVO Betrachtung
Ollama + DSGVO
- Standort-Vorteil: Self-hosted auf deinem Server = EU-basiert
- Datenschutz-Impact: Keine Übermittlung außerhalb der EU
- Compliance-Kosten: Niedrig (nur Dokumentation nötig)
- Audit: Einfach (dein Server, volle Kontrolle)
Cloud LLMs + DSGVO
- Standort-Problem: Claude/OpenAI/Google sind oft US-basiert
- Datenschutz-Impact: Standard Contractual Clauses (SCCs) erforderlich, aber seit Schrems II umstritten
- Compliance-Kosten: Mittel-Hoch (DPA abschließen, Rechtsprüfung)
- Audit: Schwieriger (auf Provider-Compliance verlassen)
Österreichische DSB Guidance: Falls personenbezogene Daten der EU-Bürger verarbeitet werden → Ollama ist die sicherere Wahl. Cloud-LLMs sind möglich, aber brauchen explizite rechtliche Überprüfung + DPA.
Integration in bestehende Systeme
Ollama in bestehende Apps
# Einfache Integration
import requests
def generate_with_fallback(prompt, model="llama3:8b"):
try:
response = requests.post(
"http://localhost:11434/api/generate",
json={"model": model, "prompt": prompt, "stream": False},
timeout=30
)
return response.json()["response"]
except requests.exceptions.ConnectionError:
# Fallback zu Cloud
print("Ollama unavailable, falling back to Cloud API")
return call_cloud_api(prompt)
Cloud LLM Integration
# Claude / OpenAI
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-6",
max_tokens=1024,
messages=[{"role": "user", "content": prompt}]
)
return message.content[0].text
Monitoring & Cost-Tracking
Ollama-Kosten tracken
# GPU Stromkosten berechnen
# RTX 4090: ~450W durchschnittlich
# Preis: €0,25 pro kWh (Österreich)
# Monthly: 450W * 24h * 30d * €0,25 / 1000 = ~€81/Monat
Cloud-Kosten tracken
# Claude API
# 1M Input Tokens @ $3 = $3
# 1M Output Tokens @ $15 = $15
# Monthly tracking mit API Response Objects:
def track_cloud_costs(response):
input_cost = response.usage.input_tokens / 1_000_000 * 0.003
output_cost = response.usage.output_tokens / 1_000_000 * 0.015
total = input_cost + output_cost
print(f"This request: ${total:.4f}")
return total
Fallback-Strategien (Hybrid Robustness)
Szenario: Ollama ist down
def call_llm_with_fallback(prompt, model="llama3:8b"):
# Versuche lokal zuerst
try:
return call_ollama(prompt, model)
except ConnectionError:
# Fallback zu Cloud
print("Local Ollama down, using Claude API")
return call_claude(prompt)
Szenario: Cloud ist teuer geworden
Quartalsweise Review:
1. Token-Volume tracken
2. Mit lokal Kosten vergleichen
3. Wenn Cloud > €500/Monat → auf Hybrid wechseln
4. Wenn Cloud > €1000/Monat → Ollama Single-GPU setup
Performance unter Last (Real-World Szenario)
Test: 100 Requests parallel
| Setup | Latency (avg) | Throughput | Fehler |
|---|---|---|---|
| Ollama (RTX 4090) | 150ms | 50/sec | 0% |
| Ollama (RTX 4070) | 350ms | 20/sec | 0% |
| Cloud (Claude API) | 800ms | 5/sec | <1% |
Schluss: Ollama deutlich besser unter Last. Cloud hat niedrigere Latenz, aber Bottleneck bei Durchsatz.
Einfaches Entscheidungs-Flowchart
START: Wieviel Tokens brauchst du pro Monat?
├─ < 5M Tokens/Monat
│ └─ → Cloud (einfach, günstiger)
│
├─ 5-20M Tokens/Monat
│ └─ → Hybrid (Ollama + Cloud Fallback)
│
├─ 20-50M Tokens/Monat
│ └─ → Ollama (RTX 4070) + Test Cloud für komplexe Tasks
│
└─ > 50M Tokens/Monat
└─ → Ollama (Multi-GPU) oder Enterprise Cloud
Zusammenfassung: Wann was wählen
| Kriterium | Ollama | Cloud |
|---|---|---|
| Budget: Gering (<€100/Mo) | ✓ | ✗ (nur sehr kleine Volumen) |
| Budget: Mittel (€100-500/Mo) | ✓ (Hardware-Amort) | ✓ (kleine Firmen) |
| Budget: Hoch (>€500/Mo) | ✓ (ROI nach 1 Jahr) | ✗ (zu teuer) |
| DSGVO-Critical | ✓✓ | ⚠️ (braucht DPA + Rechtsprüfung) |
| Multimodal (Bilder) | ✗ (nur Text+Bilder lokal) | ✓ |
| Höchste Qualität | ⚠️ (70B Models gut) | ✓ (Opus besser) |
| Dev Speed | ⚠️ (Setup nötig) | ✓ (sofort) |
| Kontrollbedürfnis | ✓✓ | ✗ |
Finale Empfehlung (2026): Wer Datenschutz ernst nimmt oder >20M Tokens/Monat braucht → Ollama mit RTX 4070+. Wer schnell starten will und klein anfängt → Cloud mit Migration-Path zu Ollama nach 6 Monaten.
