Was ist Training?
Training ist der Prozess, einem neuronalen Netzwerk beizubringen, eine Aufgabe auszuführen, indem man es Beispielen aussetzt und seine Parameter basierend auf Fehlern anpasst.
Trainingsphasen
Die Stufen des Trainings eines neuronalen Netzwerks.
Initialisierung
Zufällige Startgewichte setzen. Gute Initialisierung hilft beim Training.
Forward Pass
Eingabe fließt durch das Netzwerk, um Vorhersagen zu produzieren.
Verlustberechnung
Vorhersagen mit der Ground Truth durch eine Verlustfunktion vergleichen.
Backpropagation
Gradienten des Verlusts bezüglich jedes Gewichts berechnen.
Optimierung
Gewichte mit Gradientenabstieg aktualisieren.
Schlüsselkonzepte
Epoche
Ein vollständiger Durchlauf durch den gesamten Trainingsdatensatz.
Batch-Größe
Anzahl der Beispiele, die vor der Gewichtsaktualisierung verarbeitet werden.
Überanpassung
Das Modell merkt sich Trainingsdaten, versagt aber bei neuen Daten.
Regularisierung
Techniken zur Vermeidung von Überanpassung (Dropout, Gewichtszerfall).
Trainingsfortschritt-Visualisierer
Trainiere ein lineares Neuron, prüfe seine Vorhersagen und vergleiche Trainings- und Validierungsfehler.
Ein lineares Neuron trainieren
Der Browser aktualisiert w und b tatsächlich per Gradientenabstieg auf dem mittleren quadratischen Fehler: Vorhersage = w·x + b. Blaue Punkte sind Trainingsdaten; orange Punkte gehören zur getrennten Validierung. Zielwerte und Anfangsgewichte sind fest, damit Läufe vergleichbar sind.
Ein einzelnes lineares Neuron kann nicht jeden verrauschten Punkt treffen. Validierungs- und Trainingsfehler können sich unterschiedlich entwickeln. Es gibt keine allgemeine Epoche, ab der Overfitting beginnt. Probiere eine starke L2-Strafe, um Underfitting zu sehen.
Wichtige Erkenntnisse
- 1Training reduziert iterativ Vorhersagefehler
- 2Prüfe mit getrennten Daten, ob das Modell über das Trainingsset hinaus generalisiert.
- 3Batch-Größe und Lernrate beeinflussen das Training erheblich
- 4Moderne LLMs erfordern massive Rechenleistung für das Training