Lokales Gedächtnis, kein Token-Shortcut
Eine N-Gramm-Tabelle ordnet kurzen Tokenfolgen gelernte Vektoren zu. Ein geladener Vektor wird nahe dem Embedding oder einem frühen Hidden Layer zur aktuellen Tokenrepräsentation addiert; das Backbone berechnet weiterhin Hidden State und Next-Token-Logits.
Tabelle und Backbone lernen gemeinsam. Häufige lokale Regelmäßigkeiten können Tabellenkapazität belegen und wenig Dense Compute ergänzen – doch ein Lookup gibt weder das nächste Token aus noch garantiert es dieses.
Generieren mit und ohne N-Gramm-Gedächtnis
Beide Pfade starten mit denselben Tokens, derselben Basisrepräsentation und denselben Logits vor dem Lookup. Wechsle das Beispiel und sieh, wann lokales Gedächtnis hilft – und wann nicht.
The capital of France is▌Dieselbe Basis-Tokenrepräsentation
xₜ = token_embed(t)Dieselben beispielhaften Ausgangsscores
Paris4.2the3.8located2.9Ohne N-Gramm-Embeddings
Normaler Modellpfad
xₜ → backbone → hₜ → LM headDas Backbone muss die vertraute Fortsetzung aus seinem normalen Hidden State ableiten.
Beispielhafte spätere Logits
Paris6.1the4.0located3.1Mit N-Gramm-Embeddings
Bigramm-/Trigramm-Lookup
[France · is] + [of · France · is] → gelernte Zeilen gefundenGeladenen Vektor addieren
x′ₜ = xₜ + e_phraseNormaler Modellpfad
x′ₜ → backbone → h′ₜ → LM headDie passenden lokalen Muster laden einen trainierten Vektor. Nach der Addition geben spätere Layer der passenden Fortsetzung mehr Gewicht.
Beispielhafte spätere Logits
Paris7.8the3.5located2.7Der Vektor verändert die Hidden-Repräsentation, nicht direkt die Antwort. Backbone und LM Head erzeugen und sampeln weiterhin die Next-Token-Verteilung; ein Lookup ist ein gelernter Bias, nie eine garantierte Fortsetzung.
Woher Gewinne kommen
- Häufige Phrasen und Syntaxmuster werden zu wiederverwendbaren lokalen Vektoren, statt vollständig von Dense Layers rekonstruiert zu werden.
- Große Lookup-Tabellen ergänzen Parameterkapazität, während jedes Token nur wenige Zeilen liest; die zusätzlichen FLOPs können klein bleiben.
- Deterministische Adressierung ist günstig und lässt sich vorladen; nützliche Vektoren verändern spätere Logits über das normale Backbone.
Wo der Lookup nutzlos ist
- Neue Kombinationen sowie seltene oder ungesehene N-Gramme haben keine gut trainierte lokale Zeile.
- Fernbezüge, semantisches Schlussfolgern und Fakten außerhalb des lokalen Fensters bleiben Aufgabe des Backbones.
- Hash-Kollisionen können fremde Muster mischen; Bandbreite, Cache-Lokalität, Host-Transfers und Batching können Latenzgewinne aufheben.
- Mehr Kapazität garantiert keine Downstream-Genauigkeit: Ein unpassender Vektor kann wirkungslos bleiben oder Rauschen addieren.
Schlüssel und Werte untersuchen
Eine kompakte Ansicht, wie lokale Tokenfolgen gelernte Zeilen adressieren.
Hash und Vektorwerte sind Beispiele; produktive Systeme wählen eigene Adressierungs- und Kollisionsstrategien.
| Position | Lokaler Schlüssel | Beispiel-Slot | Gelernter Wertvektor |
|---|---|---|---|
| t=1 | [the · quick] | 746,393 | [1.0, 1.3, 0.9, 0.7, …] |
| t=2 | [quick · brown] | 1,712,346 | [1.1, -0.9, -0.7, 0.5, …] |
| t=3 | [brown · fox] | 18,478,650 | [1.1, 0.2, 1.4, 0.4, …] |
Praxisbeispiel: Qwen3.8-Flash-Next
Qwen nutzt Bigramm- und Trigramm-Tabellen als eine Komponente eines veröffentlichten experimentellen Sparse-Modells. Systemweite Benchmark-Gewinne lassen sich nicht allein dieser Komponente zuschreiben.
Das sind Parameter für Lookup-Kapazität, nicht 51B Dense Parameter pro Token. Nur adressierte Zeilen werden geladen.
Mechanismen nicht verwechseln
Kein N-Gramm Speculative Decoding
Speculative Decoding entwirft und prüft zukünftige Tokens. N-Gramm-Embeddings laden einen Vektor für die aktuelle Repräsentation; sie entwerfen nichts.
Keine Multi-Token Prediction (MTP)
MTP trainiert mehrere zukünftige Abstände. N-Gramm-Embeddings sind adressiertes Gedächtnis für bereits beobachtete lokale Folgen.