Wie LLMs Bilder sehen
Bildverarbeitungsfähige LLMs wandeln Bilder in Token-Sequenzen um, die zusammen mit Text verarbeitet werden können. Dies beinhaltet typischerweise das Aufteilen von Bildern in Patches und deren Kodierung mit einem Vision-Transformer.
Der Vision Transformer (ViT)
Die Vision Transformer-Architektur passt das Transformer-Modell für die Bildverarbeitung an. Anstatt Wörter zu verarbeiten, verarbeitet es Bildausschnitte.
1. In Patches aufteilen
Das Bild wird in ein Raster aus Patches fester Größe aufgeteilt (typischerweise 14x14 oder 16x16 Pixel).
2. Abflachen & Projizieren
Jeder Patch wird in einen Vektor abgeflacht und linear in einen Einbettungsraum projiziert.
3. Positionsinfo hinzufügen
Positionseinbettungen werden hinzugefügt, damit das Modell weiß, woher jeder Patch stammt.
4. Mit Transformer verarbeiten
Die Sequenz von Patch-Einbettungen wird von Standard-Transformer-Schichten verarbeitet.
Ein Bild, viele Patches
Dasselbe generierte Referenzbild, hier in große Patches zerlegt. 64, 128 und 256 Pixel machen das Raster gut sichtbar. Das sind Anschauungsgrößen, keine Architektur eines bestimmten Modells und keine API-Abrechnung.
6 × 4 = 24 Patches
Ein RGB-Patch mit P × P Pixeln enthält 3P² Zahlen. ViT flacht sie ab und projiziert sie mit einer gelernten Matrix in einen Embedding-Vektor. Dabei wird der Patch nicht einfach auf seine Durchschnittsfarbe reduziert.
Das Raster zeigt nur die Zerlegung. Es berechnet keine gelernten Bild-Embeddings. Die Fähigkeit, kleine Schrift zu lesen, hängt auch von Auflösung, Projektion, Training und Aufgabe ab.
API-Bildtoken sind eine eigene Zählregel
OpenAI-Dokumentation, geprüft am 13.09.2026. Abrechnungspatches sind nicht automatisch die Patches des Vision-Encoders.
| Modell / Modus | Beispiel oder Grenze |
|---|---|
| GPT-5-mini | 1024² px → 1024 × 1.2 ≈ 1229 Bildtoken |
| GPT-5.4 / original | 6000 px; 10,000 Patches als Skalierungsbudget |
| GPT-5.6-sol/terra/luna / original | 65,535 px; >30,000 Patches werden abgewiesen |
Genaue Skalierung, unterstützte Modi und Grenzen hängen vom Modell ab. Bildtoken, Text und Ausgabe müssen ins Kontextbudget passen.
Aktuelle Regeln und KostenrechnerWelche Details braucht die Aufgabe?
Eine grobe Szenenbeschreibung und eine exakte Seriennummer verlangen unterschiedliche Details. Bewahre das Original auf, wähle passende Ausschnitte und prüfe das Ergebnis gegen eine Referenz. Ein höher aufgelöstes Bild kann helfen, garantiert aber keine korrekte Antwort.