Präzision verändert die Darstellung
Quantisierung bildet kontinuierliche oder hochpräzise Werte auf eine endliche Menge darstellbarer Werte ab. Das kann Gewichtsspeicher und Speicherverkehr reduzieren. Die Geschwindigkeit hängt von Kernels, Hardware, Batchgröße sowie Gewichts- und Aktivierungspräzision ab. Weniger Bits bedeuten keinen festen Geschwindigkeitsgewinn oder Qualitätsverlust.
Echte Gewichtswerte runden
Ein gleichmäßiger Spielzeugquantisierer mit festen Beispielgewichten. Ändere Bitbreite und Wertebereich, um Rundungs- und Clippingfehler zu untersuchen. Daraus folgt keine Modellgenauigkeit oder Perplexität.
Darstellbare Werte
16
Mittlerer quadratischer Gewichtsfehler
0.01806
| Originalgewicht | Ganzzahlcode | Rekonstruiert | Fehler |
|---|---|---|---|
| -2.400 | 2 | -2.200 | 0.200 |
| -1.800 | 3 | -1.800 | 0.000 |
| -0.700 | 6 | -0.600 | 0.100 |
| -0.250 | 7 | -0.200 | 0.050 |
| 0.000 | 8 | 0.200 | 0.200 |
| 0.300 | 8 | 0.200 | -0.100 |
| 0.900 | 10 | 1.000 | 0.100 |
| 1.600 | 11 | 1.400 | -0.200 |
| 2.700 | 14 | 2.600 | -0.100 |
Δ = (max − min) / (2ᵇ − 1); q = clamp(round((w − min) / Δ), 0, 2ᵇ − 1); ŵ = min + qΔ.
Mit beiden Endpunkten gibt es genau 2ᵇ mögliche Werte. Null muss in diesem vereinfachten Raster nicht enthalten sein. Produktive Formate nutzen andere Raster, Gruppenskalen und Kalibrierung. Gewichtsfehler allein misst keine Aufgabenqualität.
Roher Gewichtsspeicher: 35.00 GB
Dezimale GB. Gezählt werden nur gepackte Gewichte: Parameter × Bits / 8. Skalen, Metadaten, Aktivierungen, Laufzeitpuffer und KV-Cache benötigen zusätzlichen Speicher. CPU-Offloading kann GPU-Speicher sparen, kostet aber gegebenenfalls Latenz.
Verschiedene Verfahren, verschiedene Annahmen
Post-Training Quantization (PTQ)
Ein trainiertes Modell umwandeln. Manche Verfahren nutzen Kalibrierungsdaten, um Skalen zu bestimmen oder Ausgabefehler zu verringern. Ergebnisse hängen von Methode und Kalibrierungsverteilung ab.
Quantization-Aware Training (QAT)
Das Modell während Training oder Fine-Tuning mit Quantisierungseffekten konfrontieren. Die Definition verlangt kein vollständiges Training von Grund auf; Gradientenbehandlung und Quantisierer hängen vom Verfahren ab.
QLoRA
Die Basis bleibt quantisiert und eingefroren, während kleine Adapter trainiert werden. Das ist eine Fine-Tuning-Methode, keine Garantie für unveränderte Qualität jedes quantisierten Inferenzmodells.
GGUF-Formate
GGUF ist ein Speicherformat. Namen wie Q4_K_M bezeichnen konkrete Quantisierungsrezepte; die nominelle Bitbreite ist keine exakte Gesamtspeicherrechnung. Das konkrete Artefakt und die Laufzeit prüfen.
Was passt in den Speicher?
Ein 70B-Modell benötigt 140 GB für rohe 16-Bit-Gewichte oder 35 GB für rohe 4-Bit-Gewichte, noch ohne Skalen und Laufzeitbedarf. 70B mit 4 Bit passt daher nicht vollständig in 24 GB GPU-Speicher. CPU-Offloading oder ein anderes Kompressionsverfahren kann die Ausführung ermöglichen, mit anderen Latenz- und Qualitätsabwägungen.
Qualität für die vorgesehene Aufgabe messen
Einen benannten Basis-Checkpoint und ein quantisiertes Artefakt mit gleichen Prompts, Decoding-Einstellungen und Evaluationsdaten vergleichen. Aufgabenwerte, Fehlerfälle und Latenz berichten. Ein kleiner Unterschied bei Gewichtsfehler oder Perplexität belegt keine unveränderte Code-, Reasoning- oder Faktenleistung. Für INT4 gibt es keinen universellen Anteil erhaltener Genauigkeit.