Das Strawberry-Problem ist ein Symptom
Die berühmte Frage "wie viele r stecken in strawberry?" ist nicht spannend, weil die Antwort schwierig wäre. Sie ist spannend, weil der Fehler unnatürlich wirkt. Ein Modell kann Paper zusammenfassen, Code schreiben und Pläne durchdenken, stolpert dann aber über eine kleine Aufgabe auf Zeichenebene.
Besserer Begriff: Subtoken-Blindheit
Subtoken-Blindheit beschreibt die Schwäche tokenbasierter Sprachmodelle bei Aufgaben, die Struktur innerhalb von Tokens brauchen: einzelne Buchstaben, wiederholte Zeichen, exakte Ziffernpositionen, Trennzeichen oder spaltenweise Addition.
Nicht nur Tokenisierung
Tokenisierung ist der Einstieg, aber nicht die ganze Erklärung. Forschung zu Letter Counting zeigt: Modelle erkennen Buchstaben oft, zählen sie aber nicht stabil, besonders wenn ein Buchstabe mehr als zweimal vorkommt oder die Aufgabe zuverlässigen Schritt-für-Schritt-Zustand verlangt.
Aufgaben zum Prüfen
Strawberry und Cranberry
Eine korrekte Antwort für strawberry allein belegt kein zuverlässiges Buchstabenzählen. Unbekannte Wörter, Häufigkeiten, Promptvarianten und eine benannte Modellversion prüfen. Unterschiedliche Ergebnisse allein verraten nicht, ob das Modell memoriert, gezählt oder eine andere Strategie genutzt hat.
Mehrstellige Addition
Mehrstellige Addition ist für Menschen einfach, weil wir einen festen Algorithmus benutzen. Ein Basis-LLM sieht eine Tokenfolge und sagt Text voraus. Ohne Tool oder zuverlässig gelernte Prozedur kann plausible, aber falsche Arithmetik entstehen.
IDs, Dateinamen und komische Strings
Dasselbe Muster taucht bei Hashes, SKUs, Gutschein-Codes, Groß-/Kleinschreibung, unsichtbaren Leerzeichen und Off-by-one-Zeichenpositionen auf. Der Inhalt hat wenig Semantik, deshalb ist Sprachgefühl die falsche Fähigkeit.
Tokenizer-Ansicht ausprobieren
Token-Sicht vs. Zeichen-Aufgabe
Der Tokenizer sieht wiederverwendbare Chunks. Die menschliche Aufgabe verlangt aber oft Buchstaben, Ziffern oder exakte Positionen innerhalb dieser Chunks.
Den Buchstaben r zählen
Hier zählt Code die Zeichen. Aus Token-Grenzen allein folgt nicht, ob ein Sprachmodell korrekt antwortet.
Warum das wichtig ist
Diese Fehler sind nützlich, weil sie die Grenze zwischen Sprachflüssigkeit und exakter symbolischer Manipulation sichtbar machen. Das Modell ist keine Datenbank, kein Taschenrechner und kein Zeichenarray, außer das System gibt ihm Tools oder zwingt die Struktur sichtbar in den Kontext.
Was praktisch hilft
- Das Modell die Zeichenfolge zuerst Buchstabe für Buchstabe ausschreiben lassen.
- Für Arithmetik und exakte String-Arbeit Code, Rechner oder Validierungslogik nutzen.
- Virale Benchmark-Fixes vorsichtig bewerten; nahe Varianten zeigen oft dieselbe Schwäche.
- Agenten-Tools so bauen, dass exakte Operationen außerhalb des Sprachmodells passieren.