Format-Übersicht
| Format | Best Tool | Speicher (7B) | Speed | Qualität | CPU-OK | GPU-OK |
|---|---|---|---|---|---|---|
| GGUF | LM Studio, Ollama | 3.6GB (q4) | ⭐⭐⭐ | ⭐⭐⭐ | ✅ | ✅ |
| GPTQ | AutoGPTQ, text-gen | 3.5GB (4-bit) | ⭐⭐⭐ | ⭐⭐ | ❌ | ✅ |
| AWQ | AWQ-Quantizer | 3.5GB (4-bit) | ⭐⭐⭐ | ⭐⭐ | ❌ | ✅ |
| EXL2 | ExLlamav2 | 2.8GB (3-bit) | ⭐⭐⭐⭐ | ⭐ | ❌ | ✅ |
| BNB | bitsandbytes | Dynamic | ⭐⭐ | ⭐⭐ | ✅ | ✅ |
GGUF (Best für lokale Deployment)
Größe: 7B Modell
- q8: 7.0GB (beste Qualität)
- q6_k: 5.2GB (sehr gut)
- q5_k: 4.3GB (gut)
- q4_k: 3.6GB (gut, schnell) ← Standard
- q3_k: 2.6GB (OK, sehr schnell)
Vorteile:
- CPU und GPU Support
- Universell kompatibel
- Easy zu laden
GPTQ (Schnell, aber GPU-only)
Besser als GGUF bei GPU-Inference (10-20% schneller)
Nachteil: Nur GPU, größere VRAM-Anforderung beim Laden
AWQ (Alternative zu GPTQ)
Ähnlich wie GPTQ, etwas schneller in bestimmten Szenarien
EXL2 (Extrem schnell)
ExLlama V2 Format, beste Speed aber reduzierte Qualität
Best für: API-Server mit hohem Durchsatz
BitsAndBytes (Flexibel)
4-bit und 8-bit on-the-fly Quantization für Fine-Tuning
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained(
"Qwen/Qwen2.5-7b",
load_in_4bit=True
)
Entscheidungshilfe
Lokal (LM Studio, Ollama)? → GGUF
GPU API-Server? → GPTQ oder EXL2
Fine-Tuning? → BitsAndBytes
Multi-Format? → GGUF (sicherer Fallback)
Größen-Referenz (7B Modell)
Vollständig (fp32): 28GB
fp16: 14GB
GGUF q8: 7.0GB
GGUF q6_k: 5.2GB
GGUF q5_k: 4.3GB
GGUF q4_k (Standard): 3.6GB ← Empfohlen
GPTQ 4-bit: 3.5GB
AWQ 4-bit: 3.5GB
EXL2 3-bit: 2.8GB
