Subtoken-Blindheit

Fortgeschritten

Warum Modelle brillant klingen können und trotzdem bei kleinen Buchstaben-, Ziffern- und Zählaufgaben scheitern, die für Menschen trivial wirken.

Zuletzt aktualisiert: 13. Sept. 2026

Das Strawberry-Problem ist ein Symptom

Die berühmte Frage "wie viele r stecken in strawberry?" ist nicht spannend, weil die Antwort schwierig wäre. Sie ist spannend, weil der Fehler unnatürlich wirkt. Ein Modell kann Paper zusammenfassen, Code schreiben und Pläne durchdenken, stolpert dann aber über eine kleine Aufgabe auf Zeichenebene.

Besserer Begriff: Subtoken-Blindheit

Subtoken-Blindheit beschreibt die Schwäche tokenbasierter Sprachmodelle bei Aufgaben, die Struktur innerhalb von Tokens brauchen: einzelne Buchstaben, wiederholte Zeichen, exakte Ziffernpositionen, Trennzeichen oder spaltenweise Addition.

Nicht nur Tokenisierung

Tokenisierung ist der Einstieg, aber nicht die ganze Erklärung. Forschung zu Letter Counting zeigt: Modelle erkennen Buchstaben oft, zählen sie aber nicht stabil, besonders wenn ein Buchstabe mehr als zweimal vorkommt oder die Aufgabe zuverlässigen Schritt-für-Schritt-Zustand verlangt.

Aufgaben zum Prüfen

Strawberry und Cranberry

Eine korrekte Antwort für strawberry allein belegt kein zuverlässiges Buchstabenzählen. Unbekannte Wörter, Häufigkeiten, Promptvarianten und eine benannte Modellversion prüfen. Unterschiedliche Ergebnisse allein verraten nicht, ob das Modell memoriert, gezählt oder eine andere Strategie genutzt hat.

Mehrstellige Addition

Mehrstellige Addition ist für Menschen einfach, weil wir einen festen Algorithmus benutzen. Ein Basis-LLM sieht eine Tokenfolge und sagt Text voraus. Ohne Tool oder zuverlässig gelernte Prozedur kann plausible, aber falsche Arithmetik entstehen.

IDs, Dateinamen und komische Strings

Dasselbe Muster taucht bei Hashes, SKUs, Gutschein-Codes, Groß-/Kleinschreibung, unsichtbaren Leerzeichen und Off-by-one-Zeichenpositionen auf. Der Inhalt hat wenig Semantik, deshalb ist Sprachgefühl die falsche Fähigkeit.

Tokenizer-Ansicht ausprobieren

Interaktiver Fehlermodus

Token-Sicht vs. Zeichen-Aufgabe

Der Tokenizer sieht wiederverwendbare Chunks. Die menschliche Aufgabe verlangt aber oft Buchstaben, Ziffern oder exakte Positionen innerhalb dieser Chunks.

strawberry
Tokens
3
Zeichen
10
Buchstabe r
3

Den Buchstaben r zählen

Erwartete deterministische Antwort
3

Hier zählt Code die Zeichen. Aus Token-Grenzen allein folgt nicht, ob ein Sprachmodell korrekt antwortet.

Zuverlässiger Workaround: die versteckte Struktur nach außen verlagern. Buchstaben einzeln aufzählen oder Arithmetik an Code bzw. einen Taschenrechner auslagern.

Warum das wichtig ist

Diese Fehler sind nützlich, weil sie die Grenze zwischen Sprachflüssigkeit und exakter symbolischer Manipulation sichtbar machen. Das Modell ist keine Datenbank, kein Taschenrechner und kein Zeichenarray, außer das System gibt ihm Tools oder zwingt die Struktur sichtbar in den Kontext.

Was praktisch hilft

  • Das Modell die Zeichenfolge zuerst Buchstabe für Buchstabe ausschreiben lassen.
  • Für Arithmetik und exakte String-Arbeit Code, Rechner oder Validierungslogik nutzen.
  • Virale Benchmark-Fixes vorsichtig bewerten; nahe Varianten zeigen oft dieselbe Schwäche.
  • Agenten-Tools so bauen, dass exakte Operationen außerhalb des Sprachmodells passieren.

Quellen und weiterführend