N-Gramm-Embeddings

Expertenniveau

Sieh, wie gelernte Vektoren für lokale Muster die Generierung lenken, ohne das Sprachmodell zu ersetzen.

Zuletzt aktualisiert: 27. Aug. 2026

Lokales Gedächtnis, kein Token-Shortcut

Eine N-Gramm-Tabelle ordnet kurzen Tokenfolgen gelernte Vektoren zu. Ein geladener Vektor wird nahe dem Embedding oder einem frühen Hidden Layer zur aktuellen Tokenrepräsentation addiert; das Backbone berechnet weiterhin Hidden State und Next-Token-Logits.

Tabelle und Backbone lernen gemeinsam. Häufige lokale Regelmäßigkeiten können Tabellenkapazität belegen und wenig Dense Compute ergänzen – doch ein Lookup gibt weder das nächste Token aus noch garantiert es dieses.

Generieren mit und ohne N-Gramm-Gedächtnis

Beide Pfade starten mit denselben Tokens, derselben Basisrepräsentation und denselben Logits vor dem Lookup. Wechsle das Beispiel und sieh, wann lokales Gedächtnis hilft – und wann nicht.

Szenario
Derselbe Kontext in beiden PfadenHäufiger lokaler Treffer
The capital of France is▌

Dieselbe Basis-Tokenrepräsentation

xₜ = token_embed(t)

Dieselben beispielhaften Ausgangsscores

Paris4.2
the3.8
located2.9

Ohne N-Gramm-Embeddings

Normaler Modellpfad

xₜ → backbone → hₜ → LM head

Das Backbone muss die vertraute Fortsetzung aus seinem normalen Hidden State ableiten.

Beispielhafte spätere Logits

Paris6.1
the4.0
located3.1

Mit N-Gramm-Embeddings

Bigramm-/Trigramm-Lookup

[France · is] + [of · France · is] → gelernte Zeilen gefunden

Geladenen Vektor addieren

x′ₜ = xₜ + e_phrase

Normaler Modellpfad

x′ₜ → backbone → h′ₜ → LM head

Die passenden lokalen Muster laden einen trainierten Vektor. Nach der Addition geben spätere Layer der passenden Fortsetzung mehr Gewicht.

Beispielhafte spätere Logits

Paris7.8
the3.5
located2.7

Der Vektor verändert die Hidden-Repräsentation, nicht direkt die Antwort. Backbone und LM Head erzeugen und sampeln weiterhin die Next-Token-Verteilung; ein Lookup ist ein gelernter Bias, nie eine garantierte Fortsetzung.

Woher Gewinne kommen

  • Häufige Phrasen und Syntaxmuster werden zu wiederverwendbaren lokalen Vektoren, statt vollständig von Dense Layers rekonstruiert zu werden.
  • Große Lookup-Tabellen ergänzen Parameterkapazität, während jedes Token nur wenige Zeilen liest; die zusätzlichen FLOPs können klein bleiben.
  • Deterministische Adressierung ist günstig und lässt sich vorladen; nützliche Vektoren verändern spätere Logits über das normale Backbone.

Wo der Lookup nutzlos ist

  • Neue Kombinationen sowie seltene oder ungesehene N-Gramme haben keine gut trainierte lokale Zeile.
  • Fernbezüge, semantisches Schlussfolgern und Fakten außerhalb des lokalen Fensters bleiben Aufgabe des Backbones.
  • Hash-Kollisionen können fremde Muster mischen; Bandbreite, Cache-Lokalität, Host-Transfers und Batching können Latenzgewinne aufheben.
  • Mehr Kapazität garantiert keine Downstream-Genauigkeit: Ein unpassender Vektor kann wirkungslos bleiben oder Rauschen addieren.

Schlüssel und Werte untersuchen

Eine kompakte Ansicht, wie lokale Tokenfolgen gelernte Zeilen adressieren.

N-Gramm-Ordnung

Hash und Vektorwerte sind Beispiele; produktive Systeme wählen eigene Adressierungs- und Kollisionsstrategien.

PositionLokaler SchlüsselBeispiel-SlotGelernter Wertvektor
t=1[the · quick]746,393[1.0, 1.3, 0.9, 0.7, …]
t=2[quick · brown]1,712,346[1.1, -0.9, -0.7, 0.5, …]
t=3[brown · fox]18,478,650[1.1, 0.2, 1.4, 0.4, …]

Praxisbeispiel: Qwen3.8-Flash-Next

Qwen nutzt Bigramm- und Trigramm-Tabellen als eine Komponente eines veröffentlichten experimentellen Sparse-Modells. Systemweite Benchmark-Gewinne lassen sich nicht allein dieser Komponente zuschreiben.

+51B Lookup-Parameter20 Mio. Bigramm- und Trigramm-EinträgeEinfügung an Layer 2Prefetch aus Host-Speicher

Das sind Parameter für Lookup-Kapazität, nicht 51B Dense Parameter pro Token. Nur adressierte Zeilen werden geladen.

Mechanismen nicht verwechseln

Kein N-Gramm Speculative Decoding

Speculative Decoding entwirft und prüft zukünftige Tokens. N-Gramm-Embeddings laden einen Vektor für die aktuelle Repräsentation; sie entwerfen nichts.

Keine Multi-Token Prediction (MTP)

MTP trainiert mehrere zukünftige Abstände. N-Gramm-Embeddings sind adressiertes Gedächtnis für bereits beobachtete lokale Folgen.