31 Themen
Große Sprachmodelle
Verstehe die inneren Abläufe großer Sprachmodelle, von der Tokenisierung bis zu Aufmerksamkeitsmechanismen.
Hilf mit, das hier zu verbessern
Dieser Guide ist Open Source. Hast du eine Idee für ein neues Thema? Einen Fehler gefunden? Eine Erklärung verbessern? Jeder Beitrag hilft.
Grundlagen
01
TokenisierungWie Text in Teile zerlegt wird, die das Modell versteht13. Sept. 2026
B02
Subtoken-BlindheitWarum Modelle Buchstaben, Ziffern und exakte Zählungen innerhalb von Tokens verfehlen13. Sept. 2026
I03
EinbettungenWörter in Zahlen verwandeln, die Bedeutung erfassen13. Sept. 2026
B04
Positionskodierung & RoPEWie LLMs Token-Reihenfolge mit Positionskodierung, RoPE und Long-Context-Kompromissen darstellen.12. Juli 2026
E05
Aufmerksamkeits-MechanismusWie Transformer entscheiden, welche Tokens wichtig sind13. Sept. 2026
I06
Multi-Head Attention, MQA & GQAWie Attention-Heads gelernte Projektionen parallel ausführen und wie MQA/GQA Key-Value-Heads teilen.12. Juni 2026
IVerhalten
01
TemperaturWie Logits zu Sampling-Wahrscheinlichkeiten werden.13. Sept. 2026
B02
Reasoning-Modelle & Rechenaufwand zur InferenzzeitWie Modelle zur Laufzeit mehr Rechenaufwand für Suche, Kandidaten und Verifikation einsetzen – und wann sich das lohnt.12. Juli 2026
E03
Jagged FrontierWarum Frontier-Modelle schwere Benchmarks lösen und trotzdem bei simpel wirkenden Aufgaben scheitern13. Sept. 2026
I04
KontextverfallForschung zu Kontextlänge, Position und Ablenkung mit klaren Versuchsgrenzen.13. Sept. 2026
IFähigkeiten
01
RAG (Retrieval Augmented Generation)LLM-Antworten mit abgerufenem externem Wissen anreichern13. Sept. 2026
I02
BildverarbeitungWie LLMs Bilder neben Text verarbeiten und verstehen13. Sept. 2026
B03
Visuelle HerausforderungenWo Bildmodelle scheitern: Zählen, Raumverständnis, OCR13. Sept. 2026
I04
Agentische BildverarbeitungAktive Bildanalyse durch Zoom, Zuschnitt und Code-Ausführung13. Sept. 2026
E05
MultimodalitätText, Bilder, Audio und Video in einem Modell verarbeiten13. Sept. 2026
BArchitektur
01
Transformer-ArchitekturDie grundlegende Architektur hinter GPT, BERT und allen modernen LLMs13. Sept. 2026
I02
Looped TransformersWie rekurrente Tiefe den Hidden State aktualisiert, Modellgewichte wiederverwendet und das Verhältnis von Speicher, Compute, Geschwindigkeit und Monitorbarkeit verändert.7. Sept. 2026
E03
Feed-Forward NetworksWie dasselbe MLP jede Tokenposition transformiert; Routing behandelt Mixture of Experts.13. Sept. 2026
I04
Residual Stream & LayerNormWie Residual Streams und Normalisierung tiefe Transformer-Stacks trainierbar halten.13. Sept. 2026
I05
Next-Token-VorhersageWie Logits, Softmax und Decoding Modelloutputs Token für Token zu Text machen.13. Sept. 2026
B06
LLM-TrainingVom Vortraining auf Rohdaten bis zum Feintuning mit Feedback13. Sept. 2026
I07
TrainingsdatenWoher KI-Modelle ihr Wissen beziehen: legitime Quellen, Kontroversen und synthetische Daten13. Sept. 2026
I08
Mixture of ExpertsNur einen Bruchteil der Modellparameter pro Token aktivieren13. Sept. 2026
E09
QuantisierungModellgröße durch reduzierte Zahlenpräzision verkleinern13. Sept. 2026
E10
Verschachteltes LernenLernalgorithmen, die auf mehreren Ebenen arbeiten13. Sept. 2026
E11
Multi-Token Prediction (MTP)Modelle darauf trainieren, mehrere zukünftige Tokens gleichzeitig vorherzusagen statt nur das nächste Token13. Sept. 2026
E12
N-Gramm-EmbeddingsGelernte Lookup-Tabellen für kurze lokale Tokenmuster27. Aug. 2026
E13
DestillationWissen von einem großen Modell auf ein kleineres übertragen13. Sept. 2026
I14
Fine-Tuning & LoRAGroße Modelle effizient anpassen durch Training winziger Low-Rank-Matrizen13. Sept. 2026
I15
AbliterationEntferne das Weigerungsverhalten eines Modells durch Ablation einer einzigen Richtung im Residual Stream13. Sept. 2026
E16
Spekulatives DecodingInferenz beschleunigen durch Vorhersage mit kleinerem Modell13. Sept. 2026
E