Konzepte
24 Artikel in dieser Kategorie — generiert im März 2026, redaktionell nicht geprüft. Jeder Artikel trägt diese Kennzeichnung im Kopf.

AI-Sicherheit und Alignment
RLHF, DPO, Constitutional AI — wie Modelle "sicher" gemacht werden, Jailbreaking, Prompt Injection, Verteidigungen, EU AI Act Connection
2026-03-21 · generiert, nicht geprüft
Attention-Mechanismen
Self-Attention, Cross-Attention, Multi-Head, Flash Attention, Multi-Query, Grouped-Query, Sliding Window, Sparse Patterns — komplett erklärt
2026-03-21 · generiert, nicht geprüft
Chain-of-Thought Prompting
CoT erklärt — warum es funktioniert, Zero-shot CoT, Few-shot CoT, Self-Consistency, Tree-of-Thought, Extended Thinking, wann CoT overkill ist
2026-03-21 · generiert, nicht geprüft
Diffusion-Modelle
Forward/Reverse Diffusion Process, Noise Schedules, DDPM, DDIM, Latent Diffusion, Classifier-Free Guidance — Theorie und Praxis
2026-03-21 · generiert, nicht geprüft
Embedding-Modelle
Wie Embeddings funktionieren, Training (Contrastive Learning), MTEB Benchmark, Vergleich — Sentence-Transformers, OpenAI, Nomic, BGE, E5
2026-03-21 · generiert, nicht geprüft
Fine-Tuning
Von Full Fine-Tuning bis QLoRA — Methoden erklärt, wann Fine-Tuning sinnvoll ist, Hyperparameter, Kosten, und praktische Tools
2026-03-21 · generiert, nicht geprüft
Function Calling
Wie Function Calling funktioniert, LLM Tool Use Protocol, OpenAI Format, Anthropic tool_use, Open-Source (Hermes, Gorilla) — JSON Schema, Parallel Calls
2026-03-21 · generiert, nicht geprüft
Knowledge Distillation
Teacher-Student Paradigm, Soft Labels, Temperature Scaling, Distillation für LLMs — wann distillieren, Code-Beispiele
2026-03-21 · generiert, nicht geprüft
Kontext-Fenster
Was Kontext-Fenster sind, Vergleich aller Modelle 2026, Long-Context Strategien, Needle-in-Haystack Problem, effektiv vs. beworbene Länge
2026-03-21 · generiert, nicht geprüft
LoRA und Adapter
Low-Rank Adaptation im Detail — Mathematik vereinfacht, Rang-Auswahl, QLoRA vs DoRA, Adapter mergen, praktische 30-Minuten Beispiele
2026-03-21 · generiert, nicht geprüft
Mixture of Experts (MoE)
MoE-Architektur erklärt — was Experts sind, Routing-Mechanismen, sparsame Aktivierung, Modelle (Mixtral, DeepSeek), Speicher vs. Compute Tradeoffs
2026-03-21 · generiert, nicht geprüft
Model Merging
SLERP, TIES, DARE, Linear Merge, mergekit Tool, Praktische Merge-Rezepte — wann Merging funktioniert
2026-03-21 · generiert, nicht geprüft
Multimodale Modelle
Vision-Language Models, Audio Models, Video Understanding — Architektur, Vergleich (GPT-4V, Claude 3.5 Vision, Gemini, LLaVA), praktische Use-Cases
2026-03-21 · generiert, nicht geprüft
Quantisierung
Wie große Modelle kleiner werden — von FP32 bis INT4, Formate (GGUF, GPTQ, AWQ), praktische Qualitäts-Tradeoffs und quantisieren mit llama.cpp
2026-03-21 · generiert, nicht geprüft
RAG erklärt
Retrieval Augmented Generation — wie externe Daten mit LLMs kombiniert werden, praktische Architekturen, Embedding-Modelle, und Reranking-Strategien
2026-03-21 · generiert, nicht geprüft
Reinforcement Learning
RL Basics (States, Actions, Rewards, Policies), PPO, DPO, RLHF Connection, Robotik & Games, LLM Alignment
2026-03-21 · generiert, nicht geprüft
Reranking
Cross-Encoder vs Bi-Encoder, Reranking Pipeline, Cohere Rerank, BGE-Reranker, ColBERT — RAG Integration
2026-03-21 · generiert, nicht geprüft
Speculative Decoding
Draft-then-Verify Approach, Acceptance Criteria, vLLM/llama.cpp Implementation, Medusa, Eagle, Lookahead Variants
2026-03-21 · generiert, nicht geprüft
Structured Generation
Constrained Decoding, JSON Mode, Grammar-Based Generation — Outlines, Guidance, Instructor, LMQL, Regex Constraints
2026-03-21 · generiert, nicht geprüft
Token-Effizienz bei AI Agents
Tiefe Referenz zu Token-Optimierung. Token Bloat Problem, Prompt Caching, Context Window Management, Model Selection und konkrete Kostensparmaßnahmen.
2026-03-21 · generiert, nicht geprüft
Tokenisierung
BPE, WordPiece, SentencePiece erklärt — wie Token-Counts funktionieren, Kontext-Fenster, Tokenizer-Unterschiede, Token-Kosten sparen
2026-03-21 · generiert, nicht geprüft
Transformer-Architektur
Wie Self-Attention funktioniert, warum Transformers RNNs ablösten, und die praktischen Parameter die Modelle definieren
2026-03-21 · generiert, nicht geprüft
Vektordatenbanken
Embeddings, Ähnlichkeitsmetriken, Vergleich (ChromaDB, Pinecone, Weaviate, Qdrant, Milvus, pgvector), Self-Hosted vs Cloud, HNSW und IVF Indexing
2026-03-21 · generiert, nicht geprüft
Was ist ein Agent Harness?
Konzeptionelle Tiefentaucherei in Agent Harnesses. Definition, Komponenten, Geschichte, Design Patterns und wie Claude Code als Harness funktioniert.
2026-03-21 · generiert, nicht geprüft
Weiter im Lernpfad
Der Lernpfad bringt diese Artikel in eine Reihenfolge, und der Hub führt die Bausteine, die wir im eigenen Betrieb geprüft haben.
- Lokal und selbst gehostet
- Dokumentiert und prüfbar
- Aus eigenem Betrieb
- Made in Austria