Was ist Wissensdestillation?
Knowledge Distillation trainiert einen Student darauf, nützliches Verhalten eines Teachers nachzubilden. Die Lernsignale können erzeugte Texte, weiche Ausgabeverteilungen oder Zwischenmerkmale sein. Ein kleinerer Student kann günstiger auszuführen sein; Qualität und Kompression hängen von Modell, Daten und Aufgabe ab.
„Stell dir einen Meisterkoch vor, der einem Lehrling beibringt – nicht nur die Rezepte, sondern all die subtilen Intuitionen: warum dieses Gewürz fast passt, warum diese Technik nah dran, aber nicht ganz richtig ist.“
Ein Student kann aus ausgearbeiteten Beispielen oder reichhaltigeren Wahrscheinlichkeitszielen lernen. Das sind unterschiedliche Destillationsrezepte mit verschiedenen Zugriffsanforderungen.
Das Lehrer-Schüler-Paradigma
Destillation folgt einem einfachen zweistufigen Prozess: Zürst wird ein großes, leistungsfähiges Lehrer-Modell trainiert, dann werden seine Ausgaben verwendet, um einen kleineren, effizienten Schüler zu trainieren.
Lehrer-Modell
Ein Modell, das Trainingssignale liefert. Für Sequenzdestillation kann Texterzeugung genügen; zum Angleichen von Logits oder Hidden States ist Zugriff auf diese Größen nötig.
Schüler-Modell
Das zu trainierende Modell. Es kann von einem vortrainierten Checkpoint starten und je nach Ziel aus erzeugten Beispielen, aufgeweichten Wahrscheinlichkeiten oder Merkmalen lernen.
Logit-Destillation genauer ansehen
Weiche Ziele tragen zusätzliche Information
Bei Logit-Destillation gleicht der Student eine Teacher-Verteilung über das Vokabular an. Neben dem wahrscheinlichsten Token können relative Wahrscheinlichkeiten von Alternativen ein nützliches Lernsignal liefern.
Dies ist eine Form von Destillation. Sequenzdestillation nutzt dagegen erzeugte Teacher-Antworten als Trainingsbeispiele, häufig mit normalem Supervised Fine-Tuning. Vollständige Wahrscheinlichkeitsverteilungen sind dafür nicht nötig.
Harte Labels (Traditionelles Training)
Binär: entweder richtig oder falsch. Keine Nuancen. Das Modell lernt nichts über die Beziehungen zwischen Ausgaben.
Weiche Labels (Destillation)
Reichhaltiges Signal: Jede Wahrscheinlichkeit kodiert eine Beziehung. Der Schüler lernt, dass Lyon Paris ähnlicher ist als Berlin.
Ein Schritt Logit-Destillation
Ein Spielzeugvokabular mit vier Tokens und festen Teacher-Logits. Der Student hat eigene Logits. Jeder Klick wendet den Gradienten von T² × KL(Teacher || Student) an. Vier Zahlen werden tatsächlich aktualisiert; ein Sprachmodell wird hier nicht trainiert.
| Token | One-Hot-Ziel | Teacher | Student |
|---|---|---|---|
| Paris | 1.000 | 0.517 | 0.212 |
| Lyon | 0.000 | 0.244 | 0.273 |
| London | 0.000 | 0.148 | 0.350 |
| Rome | 0.000 | 0.090 | 0.165 |
Skalierter Destillations-Loss: 1.00964 · Updates: 0
Beide Verteilungen nutzen dieselbe Temperatur. One-Hot-Labels bleiben One-Hot; Softmax bei T = 1 ist weiterhin eine Wahrscheinlichkeitsverteilung. Das Beispiel nutzt nur den weichen Loss. Im Training kann Cross-Entropy auf gelabelten Tokens hinzukommen. Sequenzdestillation trainiert dagegen mit erzeugten Teacher-Texten und benötigt keinen Logit-Zugriff.
Warum Destillation funktioniert
Weiche Ziele können Informationen über ein einzelnes Zieltoken hinaus liefern. Ob sie helfen, hängt von Teacher-Qualität, Student-Kapazität, Temperatur und Trainingsdaten ab.
Reichhaltigeres Gradientensignal
Jedes Trainingsbeispiel liefert Informationen über alle Ausgabeklassen gleichzeitig, nicht nur über die korrekte. Das bedeutet, dass jedes Beispiel dem Schüler effektiv Tausende von Beziehungen gleichzeitig beibringt.
Übertragung von dunklem Wissen
Die „Fehler“ des Lehrers sind informativ. Wenn der Lehrer 3% Wahrscheinlichkeit für „Lyon“ bei einer Frage über Frankreichs Hauptstadt zuweist, sagt er dem Schüler, dass Lyon für Frankreich relevant ist – Wissen, das harte Labels komplett verwerfen.
Bessere Generalisierung
Schüler, die über Destillation trainiert werden, generalisieren oft besser als Modelle, die nur auf harten Labels trainiert wurden, selbst wenn der Schüler viel weniger Parameter hat. Die weichen Labels wirken als leistungsstarker Regularisierer.
Stichprobeneffizienz
Da jedes Trainingsbeispiel mehr Information trägt (eine vollständige Verteilung vs. ein einzelnes Label), benötigt der Schüler weniger Beispiele, um effektiv zu lernen. Dies reduziert Trainingszeit und Datenanforderungen.
Die Destillationsverlustfunktion
Ein übliches Ziel für Logit-Destillation kombiniert Cross-Entropy auf gelabelten Tokens mit KL-Divergenz zwischen aufgeweichten Teacher- und Student-Verteilungen:
- CEKreuzentropie mit Ground Truth: stellt sicher, dass der Schüler weiterhin aus echten Labels lernt
- KLKL-Divergenz: misst, wie unterschiedlich die Verteilung des Schülers von der des Lehrers ist. Der Schüler wird für Abweichungen von den weichen Wahrscheinlichkeiten des Lehrers bestraft.
- TTemperatur: steuert, wie weich/glatt die Verteilungen sind. Höhere T enthüllt mehr Beziehungen zwischen Klassen.
- αAlpha: balanciert die beiden Verlustterme. Typische Werte liegen zwischen 0,1 und 0,9, wobei höhere Werte mehr Gewicht auf die Übereinstimmung mit dem Lehrer legen.
Der Faktor T² kompensiert die näherungsweise 1/T²-Skalierung der Gradienten bei hoher Temperatur. Das Mischgewicht muss weiterhin gewählt und evaluiert werden; ausgeglichene Losses bei jeder Temperatur sind nicht garantiert.
Arten der Destillation
Verschiedene Ansätze, je nachdem welches Wissen vom Lehrer zum Schüler übertragen wird:
Antwortbasiert
Der Schüler ahmt die endgültige Ausgabeverteilung des Lehrers nach. Dies ist die ursprüngliche und häufigste Form, eingeführt von Hinton et al. (2015). Einfach zu implementieren und effektiv für Klassifikation und Sprachmodellierung.
Merkmalsbasiert
Der Schüler lernt, Zwischendarstellungen (versteckte Zustände) des Lehrers abzugleichen, nicht nur die Ausgabe. Erfasst tieferes strukturelles Wissen. Verwendet in Modellen wie DistilBERT und TinyBERT.
Beziehungsbasiert
Überträgt die Beziehungen zwischen verschiedenen Beispielen oder Schichten, anstatt einzelne Ausgaben. Bewahrt, wie der Lehrer seine internen Repräsentationen strukturiert und wie er verschiedene Eingaben zueinander in Beziehung setzt.
Online-Destillation
Lehrer und Schüler trainieren gleichzeitig und lernen voneinander. Kein vortrainierter Lehrer erforderlich. Nützlich, wenn man es sich nicht leisten kann, zuerst ein massives Lehrer-Modell zu trainieren.
Praxisbeispiele
Destillation wird umfangreich in produktiven KI-Systemen eingesetzt:
DistilBERT (Hugging Face)
Das DistilBERT-Paper (2019) berichtet ein 40% kleineres und 60% schnelleres Modell mit 97% der BERT-Sprachverständnisleistung in seiner Evaluation. Diese Werte gehören zu dieser Studie und sind keine allgemeine Destillationsgarantie.
Text-Supervision versus Logit-Zugriff
Eine API mit Textrückgabe kann nach ihren Nutzungsbedingungen Sequenzdestillation ermöglichen. Sie liefert nicht automatisch die vollständigen Logits für ein KL-Ziel. Ein niedriger Preis oder kleiner Modellname belegt kein bestimmtes Trainingsrezept.
DeepSeek R1 Destillation
Der DeepSeek-R1-Report beschreibt Fine-Tuning von Qwen- und Llama-Modellen mit etwa 800.000 durch R1 kuratierten Beispielen. Das ist Sequenz-/Datendestillation durch Supervised Fine-Tuning, kein Beleg für das Angleichen vollständiger R1-Logits.
Wichtige Erkenntnisse
- 1Destillation überträgt Verhalten mit erzeugten Beispielen, weichen Verteilungen oder Merkmalen.
- 2Weiche Ziele sind für Logit-Destillation nützlich, aber nicht für jede Destillationsmethode erforderlich.
- 3Für ein aufgeweichtes KL-Ziel dieselbe Temperatur auf Teacher- und Student-Wahrscheinlichkeiten anwenden.
- 4Kompression und erhaltene Leistung müssen an benannten Modellen und Aufgaben gemessen werden. Es gibt keinen universellen Erhaltungsprozentsatz.
- 5Das Destillationsverfahren eines Modells aus veröffentlichten Trainingsberichten bestimmen, nicht aus Größe, Geschwindigkeit oder Preis ableiten.