Wie LLMs trainiert werden
Große Sprachmodelle durchlaufen mehrere Trainingsphasen, jede mit unterschiedlichen Zielen und Techniken. Das Verständnis dieser Pipeline ist entscheidend für das Verständnis der Modellfähigkeiten und -einschränkungen.
Der Trainingsprozess formt grundlegend, was LLMs können und was nicht. Verschiedene Trainingsansätze produzieren Modelle mit unterschiedlichen Stärken, Schwächen und Verhaltensweisen.
Interaktive Trainingspipeline
Entscheidungen und Ergebnisse jeder Stufe erkunden. Diese Übersicht nennt keine universellen Kosten, Dauern oder GPU-Zahlen.
Eine mögliche Trainingspipeline
Stufe auswählen. Nicht jede Entwicklung nutzt alle Schritte oder dieselbe Reihenfolge. Kosten und Dauer lassen sich ohne konkretes Modell, Datenbudget und Hardware nicht seriös als pauschale Zahl angeben.
Daten sammeln
Herkunft, Version, Lizenzen und beabsichtigte Nutzung dokumentieren. Öffentliche Erreichbarkeit erlaubt nicht automatisch jede Nutzung.
Ergebnis: ein prüfbares Quelleninventar.
Vollständige Trainingspipeline (8 Stufen)
Modernes LLM-Training umfasst 8 Hauptstufen, jede mit unterschiedlichen Zielen, Datenanforderungen und Rechenkosten. Das Verständnis dieser Pipeline ist entscheidend, um die Komplexität und Kosten des Trainings von Frontier-Modellen zu erfassen.
Datensammlung & Kuration
Sammeln massiver Textkorpora aus vielfältigen Quellen einschließlich Web-Crawls, Büchern, Code-Repositories und wissenschaftlichen Papers.
Datenbereinigung & Deduplizierung
Duplikate entfernen, minderwertige Inhalte filtern, Sprachen erkennen, PII entfernen und Formatierung normalisieren.
Tokenisierung
Bereinigten Text in numerische Token-Sequenzen mit BPE, SentencePiece oder Unigram-Tokenizern konvertieren.
Pre-training
Das Basismodell auf Billionen von Tokens mit Next-Token-Prediction-Ziel trainieren. Dies ist die teuerste und rechenintensivste Stufe.
Supervised Fine-Tuning (SFT)
Das Basismodell auf kuratierten Anweisung-Antwort-Paaren feintunen, um ihm beizubringen, Anweisungen zu befolgen und hilfreich zu antworten.
RLHF / Präferenz-Tuning
Modellausgaben mit menschlichen Präferenzen durch Reinforcement Learning (PPO) oder Direct Preference Optimization (DPO) alignieren.
Sicherheit & Evaluation
Red-Team das Modell, führe adversarielle Tests durch, wende Constitutional AI-Prinzipien an und benchmarke auf Standard-Evaluations-Suites.
Bereitstellungsoptimierung
Das Modell für Produktions-Deployment durch Quantisierung, Destillation und Inferenz-Infrastruktur-Setup optimieren.
PPO, DPO und GRPO
Policy-Ziel und Herkunft der Rewards unterscheiden. PPO und GRPO optimieren gesampelte Antworten; DPO kann einen festen Datensatz bevorzugter und verworfener Antwortpaare optimieren.
RLHF: Der traditionelle Ansatz
RLHF verwendet ein separates Reward-Modell, das auf menschlichen Präferenzen trainiert wird, und optimiert dann das LLM mit Reinforcement Learning (typischerweise PPO), um diese Belohnung zu maximieren.
1. Schritt 1: Präferenzen sammeln
2. Schritt 2: Reward-Modell trainieren
3. Schritt 3: RL-Optimierung
DPO: Die vereinfachte Alternative
DPO überspringt das Reward-Modell vollständig und optimiert das LLM direkt auf Präferenzdaten durch eine clevere mathematische Umformulierung.
1. Schritt 1: Präferenzen sammeln
2. Schritt 2: Direkte Optimierung
3. Schritt 3: Kein RL erforderlich
GRPO: Group Relative Policy Optimization
GRPO schätzt den Advantage relativ zu einer Gruppe gesampelter Antworten. Es vermeidet ein separates Value-/Critic-Modell. Rewards können aus Regeln oder einem gelernten Reward-Modell kommen; DeepSeekMath nutzte gelernte Reward-Modelle.
1. Antwortgruppe generieren
2. Antwortgruppe bewerten
3. Relatives Gradienten-Update
| Eigenschaft | PPO | DPO | GRPO |
|---|---|---|---|
| Lernsignal | Reward pro Rollout | Bevorzugte / verworfene Paare | Rewards einer Rollout-Gruppe |
| Separater Critic | Üblicherweise ja | Nein | Nein, gruppenbasierte Baseline |
| Reward-Modell | Möglich, je nach Aufgabe | Kein separat trainiertes Modell | Möglich; Regeln sind ebenfalls möglich |
| Arbeitslast | Rollouts und Policy-/Value-Updates | Im Offline-Fall Training auf festen Paaren | Gruppen-Rollouts und Policy-Updates |
Wichtige Erkenntnisse
- 1LLM-Training hat distinkte Stufen: Pretraining → SFT → RLHF → spezialisiertes Alignment
- 2Das RL-Paradigma (z.B. DeepSeek R1-Zero) zeigt, dass Denken aus reinem RL ohne menschliche Demonstrationen entstehen kann
- 3RLHF aligniert Modelle mit menschlichen Präferenzen; reines RL optimiert für verifizierbare Ergebnisse
- 4Moderne Modelle kombinieren oft mehrere Techniken: SFT für Anweisungsbefolgung, RLHF für Präferenzen, RL für Denken
- 5Das Verständnis der Trainingspipeline hilft, Modellverhalten und -einschränkungen zu verstehen
- 6Das Feld entwickelt sich schnell – neue Paradigmen wie reines RL verändern, wie wir über Training denken