6 Themen
LLM Inference
Verstehe, wie große Sprachmodelle effizient Text generieren — von KV-Caching über Batching-Strategien bis zur Serving-Infrastruktur.
Hilf mit, das hier zu verbessern
Dieser Guide ist Open Source. Hast du eine Idee für ein neues Thema? Einen Fehler gefunden? Eine Erklärung verbessern? Jeder Beitrag hilft.
01
KV-CacheBerechnete Keys und Values speichern, um Arbeit zu sparen13. Sept. 2026
E02
Mega-KernelsOperationen fusionieren und ganze Transformer-Schritte in einen einzigen GPU-Kernel verlagern, um Launch-Overhead und HBM-Traffic zu senken24. Sept. 2026
E03
Prompt CachingKV-Caches über API-Anfragen hinweg wiederverwenden, um Kosten und Latenz zu sparen13. Sept. 2026
I04
Batching & DurchsatzMehrere Anfragen gleichzeitig für höheren Durchsatz verarbeiten13. Sept. 2026
I05
Lokale ModellinferenzLLMs auf eigener Hardware ausführen -- Privatsphäre, Geschwindigkeit, keine API-Kosten13. Sept. 2026
B06
VRAM-RechnerSpeicherbudget für lokale LLMs aus Annahmen zu Gewichten, Cache und Laufzeit berechnen13. Sept. 2026
B