31 Themen

Große Sprachmodelle

Verstehe die inneren Abläufe großer Sprachmodelle, von der Tokenisierung bis zu Aufmerksamkeitsmechanismen.

Hilf mit, das hier zu verbessern

Dieser Guide ist Open Source. Hast du eine Idee für ein neues Thema? Einen Fehler gefunden? Eine Erklärung verbessern? Jeder Beitrag hilft.

Architektur

01
Transformer-ArchitekturDie grundlegende Architektur hinter GPT, BERT und allen modernen LLMs13. Sept. 2026
I
02
Looped TransformersWie rekurrente Tiefe den Hidden State aktualisiert, Modellgewichte wiederverwendet und das Verhältnis von Speicher, Compute, Geschwindigkeit und Monitorbarkeit verändert.7. Sept. 2026
E
03
Feed-Forward NetworksWie dasselbe MLP jede Tokenposition transformiert; Routing behandelt Mixture of Experts.13. Sept. 2026
I
04
Residual Stream & LayerNormWie Residual Streams und Normalisierung tiefe Transformer-Stacks trainierbar halten.13. Sept. 2026
I
05
Next-Token-VorhersageWie Logits, Softmax und Decoding Modelloutputs Token für Token zu Text machen.13. Sept. 2026
B
06
LLM-TrainingVom Vortraining auf Rohdaten bis zum Feintuning mit Feedback13. Sept. 2026
I
07
TrainingsdatenWoher KI-Modelle ihr Wissen beziehen: legitime Quellen, Kontroversen und synthetische Daten13. Sept. 2026
I
08
Mixture of ExpertsNur einen Bruchteil der Modellparameter pro Token aktivieren13. Sept. 2026
E
09
QuantisierungModellgröße durch reduzierte Zahlenpräzision verkleinern13. Sept. 2026
E
10
Verschachteltes LernenLernalgorithmen, die auf mehreren Ebenen arbeiten13. Sept. 2026
E
11
Multi-Token Prediction (MTP)Modelle darauf trainieren, mehrere zukünftige Tokens gleichzeitig vorherzusagen statt nur das nächste Token13. Sept. 2026
E
12
N-Gramm-EmbeddingsGelernte Lookup-Tabellen für kurze lokale Tokenmuster27. Aug. 2026
E
13
DestillationWissen von einem großen Modell auf ein kleineres übertragen13. Sept. 2026
I
14
Fine-Tuning & LoRAGroße Modelle effizient anpassen durch Training winziger Low-Rank-Matrizen13. Sept. 2026
I
15
AbliterationEntferne das Weigerungsverhalten eines Modells durch Ablation einer einzigen Richtung im Residual Stream13. Sept. 2026
E
16
Spekulatives DecodingInferenz beschleunigen durch Vorhersage mit kleinerem Modell13. Sept. 2026
E