Training auf Ergebnissen, nicht auf Meinungen
Training mit verifizierbaren Rewards funktioniert, wenn ein Modell oder Agent eine echte Aufgabe angehen kann und ein externer Prüfer das Ergebnis bewerten kann. Deshalb sind Mathematik, Code, Browser-Aufgaben und Tool-nutzende Agenten so interessant: Der Reward kann aus der Welt kommen, nicht nur aus menschlichen Präferenz-Labels.
Der Reward-Loop
1. Ziel definieren
Beschreibe das gewünschte Ergebnis und seine Prüfung. Ein bestandener Test muss zur tatsächlichen Nutzeraufgabe passen.
2. Kandidaten ausführen
Stelle eine isolierte, zurücksetzbare Umgebung mit passenden Daten, Tools und Berechtigungen bereit.
3. Ergebnis prüfen
Vergleiche das erzeugte Artefakt oder den Zustand mit Referenzwerten, Tests oder Bedingungen. Untersuche die blinden Flecken des Prüfers.
4. Feedback nutzen
Bewerte Kandidaten oder sammle Trainingsdaten. Modellgewichte ändern sich nur durch ein tatsächliches Training; diese Demo trainiert kein Modell.
Den Prüfer testen, bevor man der Belohnung vertraut
Alle Funktionen und Tests laufen lokal. Die Aufgabe ist, ganze Zahlen in einem Array zu addieren. Das öffentliche Beispiel allein unterscheidet keine allgemeine Lösung von einer angepassten Antwort. Die Testzahlen beziehen sich nur auf die gezeigten Fälle.
values => 3
| Test | Eingabe | Erwartet | Tatsächlich | Ergebnis |
|---|---|---|---|---|
| Öffentliches Beispiel | [1,2] | 3 | 3 | Bestanden |
Bestandene Tests: 1 / 1
Vergleiche den schwachen mit dem exakten Prüfer. Mehr bestandene Tests bei einer schwachen Belohnungsregel belegen keinen Aufgabenerfolg. Zusätzliche Fälle schließen diese konkrete Lücke ein Stück weit; sie beweisen keine allgemeine Korrektheit.
Realistische Umgebungen sind das Produkt
Code
Repository, sichtbare Tests, getrennte Regressionstests und Laufzeitverhalten.
Dokumente
Quelldaten, Formeln, erwartete Summen und geforderte Struktur.
Browserablauf
Vorbereiteter Anwendungszustand und Prüfung des Endzustands, nicht nur eine Liste von Klicks.
Warum das schwer ist
- Ein Prüfer kann eine Abkürzung belohnen, die die eigentliche Aufgabe verletzt.
- Trenne Evaluationsfälle von Optimierungsfällen und untersuche verdächtige Erfolge.
- Testfälle sind endlich. Generalisierung hängt von Aufgabenabdeckung und Einsatzbedingungen ab.