Bildverarbeitung

Einsteiger

Wie moderne LLMs visuelle Informationen neben Text verarbeiten und verstehen.

Zuletzt aktualisiert: 13. Sept. 2026

Wie LLMs Bilder sehen

Bildverarbeitungsfähige LLMs wandeln Bilder in Token-Sequenzen um, die zusammen mit Text verarbeitet werden können. Dies beinhaltet typischerweise das Aufteilen von Bildern in Patches und deren Kodierung mit einem Vision-Transformer.

Der Vision Transformer (ViT)

Die Vision Transformer-Architektur passt das Transformer-Modell für die Bildverarbeitung an. Anstatt Wörter zu verarbeiten, verarbeitet es Bildausschnitte.

1. In Patches aufteilen

Das Bild wird in ein Raster aus Patches fester Größe aufgeteilt (typischerweise 14x14 oder 16x16 Pixel).

2. Abflachen & Projizieren

Jeder Patch wird in einen Vektor abgeflacht und linear in einen Einbettungsraum projiziert.

3. Positionsinfo hinzufügen

Positionseinbettungen werden hinzugefügt, damit das Modell weiß, woher jeder Patch stammt.

4. Mit Transformer verarbeiten

Die Sequenz von Patch-Einbettungen wird von Standard-Transformer-Schichten verarbeitet.

Dosovitskiy et al.: An Image is Worth 16x16 Words

Ein Bild, viele Patches

Dasselbe generierte Referenzbild, hier in große Patches zerlegt. 64, 128 und 256 Pixel machen das Raster gut sichtbar. Das sind Anschauungsgrößen, keine Architektur eines bestimmten Modells und keine API-Abrechnung.

6 × 4 = 24 Patches

Ein RGB-Patch mit P × P Pixeln enthält 3P² Zahlen. ViT flacht sie ab und projiziert sie mit einer gelernten Matrix in einen Embedding-Vektor. Dabei wird der Patch nicht einfach auf seine Durchschnittsfarbe reduziert.

Das Raster zeigt nur die Zerlegung. Es berechnet keine gelernten Bild-Embeddings. Die Fähigkeit, kleine Schrift zu lesen, hängt auch von Auflösung, Projektion, Training und Aufgabe ab.

API-Bildtoken sind eine eigene Zählregel

OpenAI-Dokumentation, geprüft am 13.09.2026. Abrechnungspatches sind nicht automatisch die Patches des Vision-Encoders.

Modell / ModusBeispiel oder Grenze
GPT-5-mini1024² px → 1024 × 1.2 ≈ 1229 Bildtoken
GPT-5.4 / original6000 px; 10,000 Patches als Skalierungsbudget
GPT-5.6-sol/terra/luna / original65,535 px; >30,000 Patches werden abgewiesen

Genaue Skalierung, unterstützte Modi und Grenzen hängen vom Modell ab. Bildtoken, Text und Ausgabe müssen ins Kontextbudget passen.

Aktuelle Regeln und Kostenrechner

Welche Details braucht die Aufgabe?

Eine grobe Szenenbeschreibung und eine exakte Seriennummer verlangen unterschiedliche Details. Bewahre das Original auf, wähle passende Ausschnitte und prüfe das Ergebnis gegen eine Referenz. Ein höher aufgelöstes Bild kann helfen, garantiert aber keine korrekte Antwort.