Architektur
6 Artikel in dieser Kategorie — generiert im März 2026, redaktionell nicht geprüft. Jeder Artikel trägt diese Kennzeichnung im Kopf.

AI Gateway Pattern: Intelligentes LLM-Routing
API Gateway Design für LLMs: Load Balancing, Rate Limiting, Fallback Chains, Kostentracking auf Gateway-Ebene.
2026-03-21 · generiert, nicht geprüft
AI Pipeline Design: ETL für LLM-Systeme
Data Ingestion, Preprocessing, Embedding, Indexing für RAG und Inference. Apache Airflow, Prefect, Dagster.
2026-03-21 · generiert, nicht geprüft
Caching für AI: Embedding Cache, Semantic Cache, KV Cache
KV-Cache, Semantic Caching (GPTCache), Redis Embedding-Cache. Kostensparen und Latenz reduzieren.
2026-03-21 · generiert, nicht geprüft
Inference-Server für LLMs: vLLM, TGI, Triton
Text Generation Inference, vLLM, Triton für Production LLM Serving. Continuous Batching, PagedAttention, Speculative Decoding.
2026-03-21 · generiert, nicht geprüft
Load Balancing für LLMs: Routing-Strategien
Round-Robin vs. Token-Aware Routing, Multi-Model Deployment, A/B Testing, Failover Strategien.
2026-03-21 · generiert, nicht geprüft
Microservices für AI: Skalierung von LLM-Systemen
Microservice-Patterns für KI: Model Serving, API Gateways, Sidecar-Pattern. Praktische Docker-Compose und Kubernetes-Beispiele.
2026-03-21 · generiert, nicht geprüft
Weiter im Lernpfad
Der Lernpfad bringt diese Artikel in eine Reihenfolge, und der Hub führt die Bausteine, die wir im eigenen Betrieb geprüft haben.
- Lokal und selbst gehostet
- Dokumentiert und prüfbar
- Aus eigenem Betrieb
- Made in Austria