Lerne KI

Interaktiver Leitfaden

Themen
Ein Projekt vonLMF
GitHub·Updates
Künstliche IntelligenzLLM Inference
6 Themen

LLM Inference

Verstehe, wie große Sprachmodelle effizient Text generieren — von KV-Caching über Batching-Strategien bis zur Serving-Infrastruktur.

Hilf mit, das hier zu verbessern

Dieser Guide ist Open Source. Hast du eine Idee für ein neues Thema? Einen Fehler gefunden? Eine Erklärung verbessern? Jeder Beitrag hilft.

Thema vorschlagenFehler meldenAuf GitHub markieren
01
KV-CacheBerechnete Keys und Values speichern, um Arbeit zu sparen13. Sept. 2026
E
02
Mega-KernelsOperationen fusionieren und ganze Transformer-Schritte in einen einzigen GPU-Kernel verlagern, um Launch-Overhead und HBM-Traffic zu senken24. Sept. 2026
E
03
Prompt CachingKV-Caches über API-Anfragen hinweg wiederverwenden, um Kosten und Latenz zu sparen13. Sept. 2026
I
04
Batching & DurchsatzMehrere Anfragen gleichzeitig für höheren Durchsatz verarbeiten13. Sept. 2026
I
05
Lokale ModellinferenzLLMs auf eigener Hardware ausführen -- Privatsphäre, Geschwindigkeit, keine API-Kosten13. Sept. 2026
B
06
VRAM-RechnerSpeicherbudget für lokale LLMs aus Annahmen zu Gewichten, Cache und Laufzeit berechnen13. Sept. 2026
B
Zurück zu allen Themen