Quantisierung

Expertenniveau

Gewichte mit weniger Bits darstellen, den entstehenden Fehler prüfen und Speicherersparnis von Modellqualität unterscheiden.

Zuletzt aktualisiert: 13. Sept. 2026

Präzision verändert die Darstellung

Quantisierung bildet kontinuierliche oder hochpräzise Werte auf eine endliche Menge darstellbarer Werte ab. Das kann Gewichtsspeicher und Speicherverkehr reduzieren. Die Geschwindigkeit hängt von Kernels, Hardware, Batchgröße sowie Gewichts- und Aktivierungspräzision ab. Weniger Bits bedeuten keinen festen Geschwindigkeitsgewinn oder Qualitätsverlust.

Echte Gewichtswerte runden

Ein gleichmäßiger Spielzeugquantisierer mit festen Beispielgewichten. Ändere Bitbreite und Wertebereich, um Rundungs- und Clippingfehler zu untersuchen. Daraus folgt keine Modellgenauigkeit oder Perplexität.

Darstellbare Werte

16

Mittlerer quadratischer Gewichtsfehler

0.01806

OriginalgewichtGanzzahlcodeRekonstruiertFehler
-2.4002-2.2000.200
-1.8003-1.8000.000
-0.7006-0.6000.100
-0.2507-0.2000.050
0.00080.2000.200
0.30080.200-0.100
0.900101.0000.100
1.600111.400-0.200
2.700142.600-0.100

Δ = (max − min) / (2ᵇ − 1); q = clamp(round((w − min) / Δ), 0, 2ᵇ − 1); ŵ = min + qΔ.

Mit beiden Endpunkten gibt es genau 2ᵇ mögliche Werte. Null muss in diesem vereinfachten Raster nicht enthalten sein. Produktive Formate nutzen andere Raster, Gruppenskalen und Kalibrierung. Gewichtsfehler allein misst keine Aufgabenqualität.

Roher Gewichtsspeicher: 35.00 GB

Dezimale GB. Gezählt werden nur gepackte Gewichte: Parameter × Bits / 8. Skalen, Metadaten, Aktivierungen, Laufzeitpuffer und KV-Cache benötigen zusätzlichen Speicher. CPU-Offloading kann GPU-Speicher sparen, kostet aber gegebenenfalls Latenz.

Verschiedene Verfahren, verschiedene Annahmen

Post-Training Quantization (PTQ)

Ein trainiertes Modell umwandeln. Manche Verfahren nutzen Kalibrierungsdaten, um Skalen zu bestimmen oder Ausgabefehler zu verringern. Ergebnisse hängen von Methode und Kalibrierungsverteilung ab.

Quantization-Aware Training (QAT)

Das Modell während Training oder Fine-Tuning mit Quantisierungseffekten konfrontieren. Die Definition verlangt kein vollständiges Training von Grund auf; Gradientenbehandlung und Quantisierer hängen vom Verfahren ab.

QLoRA

Die Basis bleibt quantisiert und eingefroren, während kleine Adapter trainiert werden. Das ist eine Fine-Tuning-Methode, keine Garantie für unveränderte Qualität jedes quantisierten Inferenzmodells.

GGUF-Formate

GGUF ist ein Speicherformat. Namen wie Q4_K_M bezeichnen konkrete Quantisierungsrezepte; die nominelle Bitbreite ist keine exakte Gesamtspeicherrechnung. Das konkrete Artefakt und die Laufzeit prüfen.

Was passt in den Speicher?

Ein 70B-Modell benötigt 140 GB für rohe 16-Bit-Gewichte oder 35 GB für rohe 4-Bit-Gewichte, noch ohne Skalen und Laufzeitbedarf. 70B mit 4 Bit passt daher nicht vollständig in 24 GB GPU-Speicher. CPU-Offloading oder ein anderes Kompressionsverfahren kann die Ausführung ermöglichen, mit anderen Latenz- und Qualitätsabwägungen.

Qualität für die vorgesehene Aufgabe messen

Einen benannten Basis-Checkpoint und ein quantisiertes Artefakt mit gleichen Prompts, Decoding-Einstellungen und Evaluationsdaten vergleichen. Aufgabenwerte, Fehlerfälle und Latenz berichten. Ein kleiner Unterschied bei Gewichtsfehler oder Perplexität belegt keine unveränderte Code-, Reasoning- oder Faktenleistung. Für INT4 gibt es keinen universellen Anteil erhaltener Genauigkeit.

Quellen und Vertiefung

Weiter zu LoRA und Adaptertraining →