LLM-Training

Fortgeschritten

Wie große Sprachmodelle trainiert werden: von Pretraining bis RLHF.

Zuletzt aktualisiert: 13. Sept. 2026

Wie LLMs trainiert werden

Große Sprachmodelle durchlaufen mehrere Trainingsphasen, jede mit unterschiedlichen Zielen und Techniken. Das Verständnis dieser Pipeline ist entscheidend für das Verständnis der Modellfähigkeiten und -einschränkungen.

Der Trainingsprozess formt grundlegend, was LLMs können und was nicht. Verschiedene Trainingsansätze produzieren Modelle mit unterschiedlichen Stärken, Schwächen und Verhaltensweisen.

Interaktive Trainingspipeline

Entscheidungen und Ergebnisse jeder Stufe erkunden. Diese Übersicht nennt keine universellen Kosten, Dauern oder GPU-Zahlen.

Eine mögliche Trainingspipeline

Stufe auswählen. Nicht jede Entwicklung nutzt alle Schritte oder dieselbe Reihenfolge. Kosten und Dauer lassen sich ohne konkretes Modell, Datenbudget und Hardware nicht seriös als pauschale Zahl angeben.

Daten sammeln

Herkunft, Version, Lizenzen und beabsichtigte Nutzung dokumentieren. Öffentliche Erreichbarkeit erlaubt nicht automatisch jede Nutzung.

Ergebnis: ein prüfbares Quelleninventar.

Vollständige Trainingspipeline (8 Stufen)

Modernes LLM-Training umfasst 8 Hauptstufen, jede mit unterschiedlichen Zielen, Datenanforderungen und Rechenkosten. Das Verständnis dieser Pipeline ist entscheidend, um die Komplexität und Kosten des Trainings von Frontier-Modellen zu erfassen.

1

Datensammlung & Kuration

Sammeln massiver Textkorpora aus vielfältigen Quellen einschließlich Web-Crawls, Büchern, Code-Repositories und wissenschaftlichen Papers.

2

Datenbereinigung & Deduplizierung

Duplikate entfernen, minderwertige Inhalte filtern, Sprachen erkennen, PII entfernen und Formatierung normalisieren.

3

Tokenisierung

Bereinigten Text in numerische Token-Sequenzen mit BPE, SentencePiece oder Unigram-Tokenizern konvertieren.

4

Pre-training

Das Basismodell auf Billionen von Tokens mit Next-Token-Prediction-Ziel trainieren. Dies ist die teuerste und rechenintensivste Stufe.

5

Supervised Fine-Tuning (SFT)

Das Basismodell auf kuratierten Anweisung-Antwort-Paaren feintunen, um ihm beizubringen, Anweisungen zu befolgen und hilfreich zu antworten.

6

RLHF / Präferenz-Tuning

Modellausgaben mit menschlichen Präferenzen durch Reinforcement Learning (PPO) oder Direct Preference Optimization (DPO) alignieren.

7

Sicherheit & Evaluation

Red-Team das Modell, führe adversarielle Tests durch, wende Constitutional AI-Prinzipien an und benchmarke auf Standard-Evaluations-Suites.

8

Bereitstellungsoptimierung

Das Modell für Produktions-Deployment durch Quantisierung, Destillation und Inferenz-Infrastruktur-Setup optimieren.

PPO, DPO und GRPO

Policy-Ziel und Herkunft der Rewards unterscheiden. PPO und GRPO optimieren gesampelte Antworten; DPO kann einen festen Datensatz bevorzugter und verworfener Antwortpaare optimieren.

RLHF: Der traditionelle Ansatz

RLHF verwendet ein separates Reward-Modell, das auf menschlichen Präferenzen trainiert wird, und optimiert dann das LLM mit Reinforcement Learning (typischerweise PPO), um diese Belohnung zu maximieren.

1. Schritt 1: Präferenzen sammeln

2. Schritt 2: Reward-Modell trainieren

3. Schritt 3: RL-Optimierung

DPO: Die vereinfachte Alternative

DPO überspringt das Reward-Modell vollständig und optimiert das LLM direkt auf Präferenzdaten durch eine clevere mathematische Umformulierung.

1. Schritt 1: Präferenzen sammeln

2. Schritt 2: Direkte Optimierung

3. Schritt 3: Kein RL erforderlich

GRPO: Group Relative Policy Optimization

GRPO schätzt den Advantage relativ zu einer Gruppe gesampelter Antworten. Es vermeidet ein separates Value-/Critic-Modell. Rewards können aus Regeln oder einem gelernten Reward-Modell kommen; DeepSeekMath nutzte gelernte Reward-Modelle.

1. Antwortgruppe generieren

2. Antwortgruppe bewerten

3. Relatives Gradienten-Update

EigenschaftPPODPOGRPO
LernsignalReward pro RolloutBevorzugte / verworfene PaareRewards einer Rollout-Gruppe
Separater CriticÜblicherweise jaNeinNein, gruppenbasierte Baseline
Reward-ModellMöglich, je nach AufgabeKein separat trainiertes ModellMöglich; Regeln sind ebenfalls möglich
ArbeitslastRollouts und Policy-/Value-UpdatesIm Offline-Fall Training auf festen PaarenGruppen-Rollouts und Policy-Updates

Wichtige Erkenntnisse

  • 1LLM-Training hat distinkte Stufen: Pretraining → SFT → RLHF → spezialisiertes Alignment
  • 2Das RL-Paradigma (z.B. DeepSeek R1-Zero) zeigt, dass Denken aus reinem RL ohne menschliche Demonstrationen entstehen kann
  • 3RLHF aligniert Modelle mit menschlichen Präferenzen; reines RL optimiert für verifizierbare Ergebnisse
  • 4Moderne Modelle kombinieren oft mehrere Techniken: SFT für Anweisungsbefolgung, RLHF für Präferenzen, RL für Denken
  • 5Das Verständnis der Trainingspipeline hilft, Modellverhalten und -einschränkungen zu verstehen
  • 6Das Feld entwickelt sich schnell – neue Paradigmen wie reines RL verändern, wie wir über Training denken

Primärquellen