Verifizierbare Rewards

Expertenniveau

Wie LLMs und Agenten auf Aufgaben mit objektiven Ergebnisprüfungen trainiert werden können – von Coding-Sandboxes bis zu Office-artigen Umgebungen.

Zuletzt aktualisiert: 13. Sept. 2026

Training auf Ergebnissen, nicht auf Meinungen

Training mit verifizierbaren Rewards funktioniert, wenn ein Modell oder Agent eine echte Aufgabe angehen kann und ein externer Prüfer das Ergebnis bewerten kann. Deshalb sind Mathematik, Code, Browser-Aufgaben und Tool-nutzende Agenten so interessant: Der Reward kann aus der Welt kommen, nicht nur aus menschlichen Präferenz-Labels.

Der Reward-Loop

  1. 1. Ziel definieren

    Beschreibe das gewünschte Ergebnis und seine Prüfung. Ein bestandener Test muss zur tatsächlichen Nutzeraufgabe passen.

  2. 2. Kandidaten ausführen

    Stelle eine isolierte, zurücksetzbare Umgebung mit passenden Daten, Tools und Berechtigungen bereit.

  3. 3. Ergebnis prüfen

    Vergleiche das erzeugte Artefakt oder den Zustand mit Referenzwerten, Tests oder Bedingungen. Untersuche die blinden Flecken des Prüfers.

  4. 4. Feedback nutzen

    Bewerte Kandidaten oder sammle Trainingsdaten. Modellgewichte ändern sich nur durch ein tatsächliches Training; diese Demo trainiert kein Modell.

Den Prüfer testen, bevor man der Belohnung vertraut

Alle Funktionen und Tests laufen lokal. Die Aufgabe ist, ganze Zahlen in einem Array zu addieren. Das öffentliche Beispiel allein unterscheidet keine allgemeine Lösung von einer angepassten Antwort. Die Testzahlen beziehen sich nur auf die gezeigten Fälle.

values => 3
TestEingabeErwartetTatsächlichErgebnis
Öffentliches Beispiel[1,2]33Bestanden

Bestandene Tests: 1 / 1

Vergleiche den schwachen mit dem exakten Prüfer. Mehr bestandene Tests bei einer schwachen Belohnungsregel belegen keinen Aufgabenerfolg. Zusätzliche Fälle schließen diese konkrete Lücke ein Stück weit; sie beweisen keine allgemeine Korrektheit.

Realistische Umgebungen sind das Produkt

Code

Repository, sichtbare Tests, getrennte Regressionstests und Laufzeitverhalten.

Dokumente

Quelldaten, Formeln, erwartete Summen und geforderte Struktur.

Browserablauf

Vorbereiteter Anwendungszustand und Prüfung des Endzustands, nicht nur eine Liste von Klicks.

Warum das schwer ist

  • Ein Prüfer kann eine Abkürzung belohnen, die die eigentliche Aufgabe verletzt.
  • Trenne Evaluationsfälle von Optimierungsfällen und untersuche verdächtige Erfolge.
  • Testfälle sind endlich. Generalisierung hängt von Aufgabenabdeckung und Einsatzbedingungen ab.