Lokale LLMs mit Ollama geben dir volle Datenkontrolle und unbegrenzte Nutzung. Cloud-LLMs sind einfacher, aber teuer bei hohem Volumen. Hier ist der vollständige Vergleich.

Hardware-Anforderungen für Ollama

Die größte Hürde ist: Welche GPU/CPU braucht dein Modell?

GPU Memory nach Modell-Größe

Modellgröße Parameter VRAM nötig Quantization Qualität
Tiny 100M-2B 2-4GB Q4_K_M Gut für Chat
Small 2B-10B 6-16GB Q4_K_M Ausgezeichnet
Medium 10B-20B 16-24GB Q4_K_M Sehr gut
Large 20B-70B 24-48GB Q4_K_M Near-GPT-3.5
Very Large 70B-110B 80GB+ Q4_K_M GPT-4 Nähe

Quantization-Trick: Q4_K_M (4-bit Quantization) reduziert VRAM um ~75% ohne großen Qualitätsverlust. Ein 7B-Modell in FP16 (14GB) wird in Q4_K_M (~3.5GB).

Praktische GPU-Optionen

GPU VRAM Preis Tokens/sec Best For
RTX 3060 12GB $250-300 15 Llama 3 8B
RTX 4070 12GB $400-500 25 Mistral 7B + Llama 13B
RTX 4090 24GB $1200-1500 60 Llama 70B, Mixtral
A100 40GB $5000+ 100+ Production, Multi-Tenant
H100 80GB $15000+ 200+ Training, Enterprise

Sweet Spot für KMUs: RTX 4070 oder RTX 4080 (12-16GB VRAM). Kostet ~$400-600, läuft alles bis Llama 13B locker.

RAM und CPU-Anforderungen

  • System RAM: 1.5x der Modellgröße (für Llama 7B: 12GB Modell = 18GB RAM empfohlen)
  • CPU: 8-Kern genügt für Inference. Training braucht mehr.
  • Storage: 50-100GB Puffer für Modelle und Datenbank

Break-Even: Einmalige Kosten

Setup GPU RAM Storage CPU Total Stromkosten/Jahr
Budget RTX 3060 ($250) 32GB RAM ($80) 256GB SSD ($30) Ryzen 5600 ($150) ~$700 $50
Mid-Range RTX 4070 ($450) 64GB RAM ($200) 512GB SSD ($50) Ryzen 7600 ($300) ~$1.500 $105
High-End RTX 4090 ($1.500) 128GB RAM ($500) 1TB SSD ($100) Intel i9 ($500) ~$3.500 $200

Stromkosten: ~700-1000W durchschnittlich, $0.15 pro kWh = ~$100-150/Jahr.

Cloud LLM Kosten im Vergleich

Claude (Anthropic)

  • Sonnet 4.6: $3 Input / $15 Output pro 1M Tokens
  • Opus 4.6: $5 Input / $25 Output pro 1M Tokens

ChatGPT / OpenAI

  • GPT-5: $1.25 Input / $10 Output pro 1M Tokens
  • GPT-4.1: $2 Input / $8 Output pro 1M Tokens
  • GPT-4o: $2.50 Input / $10 Output pro 1M Tokens

Google Gemini

  • Gemini 1.5 Pro: $2.50 Input / $7.50 Output pro 1M Tokens

Ollama (Self-Hosted)

  • Stromkosten + Hardware-Amortisation

Break-Even Analyse: Wann lohnt sich Ollama?

Szenario: Content Writer, 25M Tokens/Monat

Cloud-Kosten (Claude Sonnet 4.6):

  • 20M Input @ $3 = $60
  • 5M Output @ $15 = $75
  • Total: $135/Monat = $1.620/Jahr

Ollama (Mid-Range, $1.500):

  • Hardware-Amortisation: $1.500 / 3 Jahre = $500/Jahr
  • Stromkosten: $105/Jahr
  • Total: $605/Jahr

Break-Even: 2.5 Jahre mit dieser Hardware. Ab Jahr 3 sparst du $1.015/Jahr.

Szenario: Kleine Firma, 100M Tokens/Monat

Cloud-Kosten (GPT-4.1):

  • 80M Input @ $2 = $160
  • 20M Output @ $8 = $160
  • Total: $320/Monat = $3.840/Jahr

Ollama (Mid-Range, $1.500):

  • Hardware-Amortisation: $500/Jahr
  • Stromkosten: $105/Jahr
  • Total: $605/Jahr

Break-Even: 5-6 Monate. Dann spart du $3.235/Jahr.

Szenario: Multi-Team, 500M+ Tokens/Monat

Cloud-Kosten (GPT-5):

  • 400M Input @ $1.25 = $500
  • 100M Output @ $10 = $1.000
  • Total: $1.500/Monat = $18.000/Jahr

Ollama (Enterprise, 2 x RTX 4090, $7.000):

  • Hardware-Amortisation: $2.333/Jahr
  • Stromkosten: $400/Jahr
  • Total: $2.733/Jahr

Ersparnis: $15.267/Jahr. ROI in 5 Monaten.

Fazit:

  • Unter 10M Tokens/Monat → Cloud ist billiger (einfacher Setup)
  • 10-50M Tokens/Monat → Ollama break-even in 1-2 Jahren
  • Über 50M Tokens/Monat → Ollama ist sofort günstiger

Modell-Qualität: Lokal vs. Cloud

Nach Task-Typ

Task Beste Local Beste Cloud Winner
Code-Generierung Llama 3 8B GPT-4 / Opus 4.6 Cloud (10% besser)
Dokumentation/Blogs Mistral 7B Claude Sonnet 4.6 Cloud (15% besser)
Datenanalyse Qwen 2.5 14B GPT-4.1 Cloud (20% besser)
Logik/Reasoning - OpenAI o3 Cloud (nur cloud verfügbar)
Allgemeiner Chat Llama 3 70B Opus 4.6 Cloud (5% besser)
Summarization Llama 3 8B Sonnet 4.6 Praktisch gleich
Übersetzung mBART Claude Sonnet Cloud (10% besser)
Zensurfreier Output Alle lokal - Lokal (nur lokal)

Resultat: Cloud-Modelle sind in Qualität 5-20% besser, aber lokale Modelle sind "gut genug" für 80% der Fälle.

Ollama Praktischer Setup (in 5 Minuten)

Installation

# macOS / Linux
curl https://ollama.ai/install.sh | sh

# oder Docker
docker run -d -v ollama:/root/.ollama -p 11434:11434 ollama/ollama

Modell laden

# Llama 3 8B (4.7GB, Q4_K_M) — Standard
ollama pull llama3:8b

# Mistral 7B (4.1GB) — Schnell und gut
ollama pull mistral:latest

# Qwen 2.5 32B (19GB) — wenn du 24GB+ VRAM hast
ollama pull qwen2.5:32b

API-Zugriff

# Ollama läuft auf http://localhost:11434
curl http://localhost:11434/api/generate -d '{
  "model": "llama3:8b",
  "prompt": "Was ist DSGVO?"
}'

In deiner App nutzen

import requests
import json

url = "http://localhost:11434/api/generate"
data = {
    "model": "llama3:8b",
    "prompt": "Schreib eine Produktbeschreibung für eine Cloud-API",
    "stream": False
}

response = requests.post(url, json=data)
result = json.loads(response.text)
print(result["response"])

Performance: Tokens per Sekunde

Modell GPU Tokens/sec Latency
Llama 3 8B RTX 4070 25 40ms
Mistral 7B RTX 4070 30 33ms
Llama 3 70B RTX 4090 50 20ms
Claude Sonnet API Cloud ~10 500-2000ms

Achtung: Cloud-APIs haben höhere Latenz wegen Netzwerk. Ollama lokal ist 10-100x schneller.

Hybrid-Ansatz: Best of Both

┌─────────────────────────────────┐
│ Deine Anwendung                 │
├─────────────────────────────────┤
│ Lokal (Ollama)                  │
│ - Schnelle Tasks (Chat, Summa)  │
│ - Interne Docs                  │
│ - Datenschutz-sensitiv          │
└────────────┬──────────────────────
             │
│ Cloud (Claude/GPT)              │
│ - Code-Review & Generation      │
│ - Komplexe Reasoning Tasks      │
│ - Multimodal (Bilder)           │
└─────────────────────────────────┘

Umsetzung:

  1. Standard-Prompts → Ollama (lokal, schnell, kostenlos)
  2. Komplexe Tasks → Cloud-API (wenn Qualität wichtig ist)
  3. Routing per Cost-Benefit (lokal zuerst, fallback zu Cloud)

DSGVO & Datenschutz

Ollama (Self-Hosted)

Vollständig DSGVO-konform

  • Keine Daten verlässt deinen Server
  • Keine Datenbearbeitung durch Dritte
  • Du bist der Daten-Processor

Cloud LLMs

⚠️ Komplex, braucht Vorsicht

  • Claude: Verarbeitet deine Eingaben, speichert nicht zum Training
  • OpenAI: Speichert API-Requests log-weise, nicht zum Training
  • Google: Ähnlich wie OpenAI
  • Wichtig: DPA mit dem Provider ist erforderlich

Für sensitive Daten (Kundendaten, Finanzen, Medizin): Ollama immer. Cloud nur mit expliziter DPA.

Wann welcher Ansatz?

Nutze Ollama (Lokal), wenn…

  • Datenschutz / DSGVO kritisch ist
  • Du über 50M Tokens/Monat brauchst
  • Du zensurfreien Output brauchst (keine Content-Filter)
  • Dein Team Tech-Skills hat
  • Du volle Kontrolle haben willst

Nutze Cloud (Claude/OpenAI), wenn…

  • Du schnell starten willst (kein Hardware-Setup)
  • Du unter 10M Tokens/Monat brauchst
  • Du Multimodal-Input brauchst (Bilder, Audio)
  • Du Reasoning-Tasks brauchst (o3 etc.)
  • Dein Budget flexibel ist

Nutze Hybrid, wenn…

  • Du großes Volumen mit Mixed-Sensitivity brauchst
  • Dein Team beides maintainen kann
  • Kosten-Optimierung + Qualität beide wichtig

Checkliste

  • Hast du eine GPU mit 12GB+ VRAM oder willst eine kaufen? → Ollama möglich
  • Sind deine Daten datenschutz-sensitiv? → Ollama oder DPA-gesicherte Cloud
  • Brauchst du Multimodal (Bilder, Audio, Video)? → Cloud-LLMs
  • Ist dein Volumen >50M Tokens/Monat? → Ollama ist günstiger
  • Brauchst du höchste Qualität (Code, Reasoning)? → Cloud > Ollama
  • Hast du weniger als 5M Tokens/Monat? → Cloud ist einfacher + günstiger

Österreich-spezifische DSGVO Betrachtung

Ollama + DSGVO

  • Standort-Vorteil: Self-hosted auf deinem Server = EU-basiert
  • Datenschutz-Impact: Keine Übermittlung außerhalb der EU
  • Compliance-Kosten: Niedrig (nur Dokumentation nötig)
  • Audit: Einfach (dein Server, volle Kontrolle)

Cloud LLMs + DSGVO

  • Standort-Problem: Claude/OpenAI/Google sind oft US-basiert
  • Datenschutz-Impact: Standard Contractual Clauses (SCCs) erforderlich, aber seit Schrems II umstritten
  • Compliance-Kosten: Mittel-Hoch (DPA abschließen, Rechtsprüfung)
  • Audit: Schwieriger (auf Provider-Compliance verlassen)

Österreichische DSB Guidance: Falls personenbezogene Daten der EU-Bürger verarbeitet werden → Ollama ist die sicherere Wahl. Cloud-LLMs sind möglich, aber brauchen explizite rechtliche Überprüfung + DPA.

Integration in bestehende Systeme

Ollama in bestehende Apps

# Einfache Integration
import requests

def generate_with_fallback(prompt, model="llama3:8b"):
    try:
        response = requests.post(
            "http://localhost:11434/api/generate",
            json={"model": model, "prompt": prompt, "stream": False},
            timeout=30
        )
        return response.json()["response"]
    except requests.exceptions.ConnectionError:
        # Fallback zu Cloud
        print("Ollama unavailable, falling back to Cloud API")
        return call_cloud_api(prompt)

Cloud LLM Integration

# Claude / OpenAI
import anthropic

client = anthropic.Anthropic()
message = client.messages.create(
    model="claude-opus-4-6",
    max_tokens=1024,
    messages=[{"role": "user", "content": prompt}]
)
return message.content[0].text

Monitoring & Cost-Tracking

Ollama-Kosten tracken

# GPU Stromkosten berechnen
# RTX 4090: ~450W durchschnittlich
# Preis: €0,25 pro kWh (Österreich)
# Monthly: 450W * 24h * 30d * €0,25 / 1000 = ~€81/Monat

Cloud-Kosten tracken

# Claude API
# 1M Input Tokens @ $3 = $3
# 1M Output Tokens @ $15 = $15
# Monthly tracking mit API Response Objects:
def track_cloud_costs(response):
    input_cost = response.usage.input_tokens / 1_000_000 * 0.003
    output_cost = response.usage.output_tokens / 1_000_000 * 0.015
    total = input_cost + output_cost
    print(f"This request: ${total:.4f}")
    return total

Fallback-Strategien (Hybrid Robustness)

Szenario: Ollama ist down

def call_llm_with_fallback(prompt, model="llama3:8b"):
    # Versuche lokal zuerst
    try:
        return call_ollama(prompt, model)
    except ConnectionError:
        # Fallback zu Cloud
        print("Local Ollama down, using Claude API")
        return call_claude(prompt)

Szenario: Cloud ist teuer geworden

Quartalsweise Review:
1. Token-Volume tracken
2. Mit lokal Kosten vergleichen
3. Wenn Cloud > €500/Monat → auf Hybrid wechseln
4. Wenn Cloud > €1000/Monat → Ollama Single-GPU setup

Performance unter Last (Real-World Szenario)

Test: 100 Requests parallel

Setup Latency (avg) Throughput Fehler
Ollama (RTX 4090) 150ms 50/sec 0%
Ollama (RTX 4070) 350ms 20/sec 0%
Cloud (Claude API) 800ms 5/sec <1%

Schluss: Ollama deutlich besser unter Last. Cloud hat niedrigere Latenz, aber Bottleneck bei Durchsatz.

Einfaches Entscheidungs-Flowchart

START: Wieviel Tokens brauchst du pro Monat?

├─ < 5M Tokens/Monat
│  └─ → Cloud (einfach, günstiger)
│
├─ 5-20M Tokens/Monat
│  └─ → Hybrid (Ollama + Cloud Fallback)
│
├─ 20-50M Tokens/Monat
│  └─ → Ollama (RTX 4070) + Test Cloud für komplexe Tasks
│
└─ > 50M Tokens/Monat
   └─ → Ollama (Multi-GPU) oder Enterprise Cloud

Zusammenfassung: Wann was wählen

Kriterium Ollama Cloud
Budget: Gering (<€100/Mo) ✗ (nur sehr kleine Volumen)
Budget: Mittel (€100-500/Mo) ✓ (Hardware-Amort) ✓ (kleine Firmen)
Budget: Hoch (>€500/Mo) ✓ (ROI nach 1 Jahr) ✗ (zu teuer)
DSGVO-Critical ✓✓ ⚠️ (braucht DPA + Rechtsprüfung)
Multimodal (Bilder) ✗ (nur Text+Bilder lokal)
Höchste Qualität ⚠️ (70B Models gut) ✓ (Opus besser)
Dev Speed ⚠️ (Setup nötig) ✓ (sofort)
Kontrollbedürfnis ✓✓

Finale Empfehlung (2026): Wer Datenschutz ernst nimmt oder >20M Tokens/Monat braucht → Ollama mit RTX 4070+. Wer schnell starten will und klein anfängt → Cloud mit Migration-Path zu Ollama nach 6 Monaten.