Monitoring deine LLM Applications ist 2026 Standard. Dieser Guide vergleicht alle Tools um zu sehen, welche für diche beste ist.
Schnell-Überblick
| Tool | Preis | Self-Hosted | Best Feature | Best For |
|---|---|---|---|---|
| Langfuse | $29/Mo | ✅ Ja | Open Source, Data Ownership | Open-Source Teams |
| LangSmith | $39/User/Mo | ⚠️ Enterprise | LangChain Integration | LangChain Shops |
| Helicone | Free-$100+ | Nein | Einfachste Setup | Developer-Friendly |
| Weights & Biases | Custom | ✅ Ja | Complete ML Ops | Research + Production |
| Arize | Custom | Nein | Enterprise Feature | Enterprise Scale |
Langfuse vs LangSmith
Langfuse (Open-Source First)
Pricing:
- Open Source: Free (selbst hosted)
- Cloud Hobby: Free Tier (50k Units/Mo)
- Cloud Pro: $29/Mo (100k Units)
- Cloud Team: $100+/Mo (unbegrenzt)
- Self-Hosted: Free (Postgres + ClickHouse + Redis nötig)
Stärken:
- "Best für Data Sovereignty" — eigene Daten
- MIT License — vollständig open
- Framework-agnostisch (funktioniert mit OpenAI SDK, LlamaIndex, CrewAI, etc.)
- Keine per-Seat Gebühren
- Transparente Unit-basierte Pricing
Schwächen:
- Self-Hosting ist Infrastruktur-intensiv
- Kleinere Community als LangSmith
- Weniger integrations out-of-the-box
Best For:
- EU-basierte Teams (GDPR)
- Teams mit Data Privacy Requirements
- Non-LangChain Frameworks
- High-Volume Usage (1000+ traces/day)
LangSmith (LangChain-Centric)
Pricing:
- Free: 1 seat, 5k traces/month
- Plus: $39/User/month
- Trace Overages: $0.50-5 pro 1k traces
- Enterprise: Custom Pricing
Stärken:
- "Deepest LangChain Integration" (native debugging tools)
- Sehr gute für LangChain/LangGraph Projekte
- Managed Service (zero DevOps)
- LangSmith Hub für Prompts/Models
Schwächen:
- Wird teuer mit Team Growth (per-user pricing)
- Nicht ideal wenn nicht LangChain
- Proprietary (keine Data Ownership)
Best For:
- LangChain-only Teams
- Teams < 5 Menschen
- Enterprise mit LangChain
Unit-basierte vs Per-Seat Pricing Impact
Szenario: Team wächst von 2 auf 10 Menschen
LANGFUSE:
- 2 Menschen: $29/Mo (1000k units = $29)
- 10 Menschen: $29/Mo (if same unit usage!)
- Warum? Nur eine Account bezahlt
LANGSMITH:
- 2 Menschen: $39 × 2 = $78/Mo
- 10 Menschen: $39 × 10 = $390/Mo
- Teuer!
WINNER: Langfuse für Teams
Integration Vergleich
| Framework | Langfuse | LangSmith | Helicone | W&B |
|---|---|---|---|---|
| LangChain | ✅ | ✅✅ (native) | ✅ | ✅ |
| LlamaIndex | ✅ | ❌ | ✅ | ✅ |
| CrewAI | ✅ | ❌ | ✅ | ✅ |
| OpenAI SDK | ✅ | ❌ | ✅ | ✅ |
| Anthropic | ✅ | ❌ | ✅ | ✅ |
| Custom | ✅ API | Manual | ✅ API | ✅ |
Fazit: Langfuse für Vielfalt, LangSmith nur wenn LangChain
Häufige Fehler
Problem #1: "LangSmith pro Team ist unbezahlbar"
- Ursache: Per-User Pricing wächst linear
- Lösung: Wechsel zu Langfuse ($29 flat)
- Einsparung: 10× bei größeren Teams
Problem #2: "Langfuse Self-Hosted ist kompliziert"
- Ursache: Braucht 3 Services (Postgres, ClickHouse, Redis)
- Lösung: Nutze Langfuse Cloud ($29) oder Docker-Compose
# Docker: fertig in 5 Min
docker-compose up -d
Problem #3: "Traces sind nicht sichtbar in LangSmith"
- Ursache: API Key falsch oder Projekt nicht konfiguriert
- Lösung: Überprüfe Projekt-URL und Export Traces via UI
Setup Guide (Langfuse Cloud)
from langfuse.callback import CallbackHandler
from langchain.chat_models import ChatOpenAI
# 1. Integrationscode
callback_handler = CallbackHandler(
public_key="pk_xxx",
secret_key="sk_xxx"
)
# 2. LangChain Model mit Monitoring
llm = ChatOpenAI(
callbacks=[callback_handler]
)
# 3. Alles trackt automatisch!
response = llm.predict("Hallo")
Das ist alles! Traces sind jetzt sichtbar in Langfuse UI.
Use Cases
Development / Debugging
→ Langfuse (bessere UX) oder LangSmith (if LangChain)
Production Monitoring
→ Langfuse Self-Hosted (Data Control) oder Arize (Enterprise)
Research / Experimentation
→ Weights & Biases (best für Metrics, Versioning)
Budget
| Team Size | Langfuse | LangSmith |
|---|---|---|
| 1 Person | $0 (Free) | $0 (Free) |
| 3 People | $29 | $117 ($39×3) |
| 10 People | $29 | $390 ($39×10) |
Langfuse ist 13× billiger bei 10 Menschen!
Helicone — Developer-Friendly Oberflächel
Besonderheit: "Einfachste Setup, API-agnostisch"
Pricing:
- Free: 50k Requests/Monat
- Hobby: $25/Mo (unlimited)
- Pro: Custom (Enterprises)
Stärken:
- Schnellste Integration (ein API-Key in deinen Requests)
- Funktioniert mit OpenAI, Anthropic, Mistral, etc.
- Schöne Visualisierungen
- Kostenlos zu testen
Schwächen:
- Nicht so tief wie LangSmith/Langfuse
- Kleinere Community
- Weniger erweiterte Features
Best For: Developer die schnell starten wollen
Weights & Biases — Research + Production
Besonderheit: "Komplettes MLOps Platform"
Pricing:
- Free: Für 1 Person
- Team: Custom (meistens €100+/Mo)
- Custom: Enterprise
Stärken:
- Nicht nur Logging, auch Versioning & Experimentation
- GPU-Monitoring möglich
- Gute für Research-Teams
- Production Pipelines
Schwächen:
- Komplexer Setup
- Overkill für einfache LLM Monitoring
- Teurer für Teams
Best For: Research Teams, die Models trainieren und deployen
Arize — Enterprise Scale
Besonderheit: "Production Monitoring für 1000+ daily Predictions"
Pricing: Custom Enterprise (€10k+/Mo typisch)
Stärken:
- Scalability für gigantische Deployments
- Drift Detection (Modell Performance sinkt mit Zeit)
- Integration in Data Pipelines
- Compliance Features
Schwächen:
- Extrem teuer
- Overkill für KMUs
- Lange Onboarding
Best For: Enterprise mit großen ML-Operationen
Deep Dive: Langfuse vs LangSmith Kosten (Großes Team Szenario)
Szenario: Team mit 15 Entwicklern, 100k Traces/Monat
Langfuse Cloud Pro
- Basis: €29/Mo
- Kosten pro 100k Traces: €0 (unbegrenzt in Pro!)
- Total: €29/Mo (unabhängig von Team-Größe!)
LangSmith
- Pro Plan: €39/User/Mo × 15 = €585/Mo
- Zusätzliche Traces-Overages: 100k Traces (kostenlos in Pro)
- Total: €585/Mo (nur wegen 15 Leuten!)
Fazit: Langfuse ist 20× billiger bei großen Teams!
Real-World Setup: Langfuse + LangChain in Production
# requirements.txt
langchain==0.1.0
langfuse==2.5.0
python-dotenv==1.0.0
# .env (nicht committen!)
LANGFUSE_PUBLIC_KEY=pk_xxx
LANGFUSE_SECRET_KEY=sk_xxx
# main.py
import os
from langfuse.callback import CallbackHandler
from langchain.chat_models import ChatOpenAI
from langchain.chains import LLMChain
# 1. Initialisiere Langfuse
langfuse_handler = CallbackHandler(
public_key=os.getenv("LANGFUSE_PUBLIC_KEY"),
secret_key=os.getenv("LANGFUSE_SECRET_KEY")
)
# 2. Erstelle LangChain mit Callback
llm = ChatOpenAI(
model="gpt-4",
callbacks=[langfuse_handler]
)
# 3. Alles wird automatisch getracked!
response = llm.predict("Was ist RAG?")
# Langfuse UI zeigt jetzt:
# - Response Zeit
# - Token Usage
# - Input/Output
# - Model + Temperature
Feature-Vergleich: Detailliert
| Feature | Langfuse | LangSmith | Helicone | W&B |
|---|---|---|---|---|
| Traces tracken | ✅ | ✅ | ✅ | ✅ |
| Cost-Tracking | ✅ | ✅ | ✅ | ✅ |
| Open Source | ✅ | ❌ | ❌ | ❌ |
| Self-Hosted | ✅ | ❌ | ❌ | ✅ |
| Experiment Tracking | ⚠️ | ✅ | ❌ | ✅ |
| Model Versioning | ⚠️ | ✅ | ❌ | ✅ |
| Collaboration Features | ✅ | ✅ | ⚠️ | ✅ |
| Drifting Detection | ❌ | ❌ | ❌ | ✅ |
| Notebooks Integration | ❌ | ❌ | ❌ | ✅ |
| API-agnostisch | ✅ | ❌ | ✅ | ✅ |
Fehlerdiagnose: Traces nicht sichtbar
Problem: "Traces werden nicht in Langfuse angezeigt"
Lösungs-Checkliste:
-
API Keys korrekt?
# Teste Connection from langfuse import Langfuse client = Langfuse( public_key="pk_xxx", secret_key="sk_xxx" ) client.flush() # Zwinge Upload -
Netzwerk erreichbar?
- Ping:
curl -I https://api.langfuse.com - Firewall blockiert HTTPS? (Seltenes Corporate-Problem)
- Ping:
-
LangChain Integrationn nicht korrekt?
# FALSCH llm = ChatOpenAI() # No callback! # RICHTIG llm = ChatOpenAI(callbacks=[langfuse_handler]) -
AsyncIO Problem?
# Wenn async verwendest, callback flushes nicht auf Zeit # Fix: client.flush() nach jedem Request aufrufen
Problem: "LangSmith Projekt nicht synchronisiert"
- Stelle sicher dass Environment Variable korrekt gesetzt ist
ls ~/.langsmith— sollte config.json existieren- LangSmith UI — klicke auf dein Projekt, kopiere exakte Project ID
- Versuche
langsmith-configCLI
Production Checklist
- Monitoring Tool ausgewählt (Langfuse empfohlen für KMUs)
- API Keys sicher in Vault gespeichert (nicht in .env!)
- Callbacks in ALLE LLM-Aufrufe integriert
- Trace-Sampling eingestellt (nicht jeden Trace tracken wenn massive Load)
- Dashboards erstellt (Trends, Error Rates, Latency)
- Alerts konfiguriert (z.B. "benachrichtige wenn Error Rate > 5%")
- Retention Policy definiert (wie lang Traces speichern?)
- Team-Access konfiguriert (wer kann Traces sehen?)
- Monthly Cost Review etabliert
Ressourcen
Letzte Aktualisierung: 21.03.2026 | Nächste Überprüfung: Juni 2026
