Reinforcement Learning

Fortgeschritten

Wie Agenten lernen, indem sie handeln, Belohnungen erhalten und ihre Policy über wiederholte Erfahrung verbessern.

Zuletzt aktualisiert: 13. Sept. 2026

Lernen aus Konsequenzen

Reinforcement Learning trainiert einen Agenten durch Interaktion. Statt für jedes Beispiel die richtige Antwort gezeigt zu bekommen, probiert der Agent Aktionen aus, erhält Belohnungen und lernt nach und nach eine Policy, die bessere langfristige Ergebnisse erzeugt.

Der schwierige Teil ist das Credit Assignment: Wenn eine Belohnung erst nach 200 Schritten eintrifft, welche früheren Entscheidungen verdienen dann Lob oder Tadel? Genau deshalb ist RL mächtig, instabil und oft teuer.

Q-Learning im Gitter

Der Agent aktualisiert Q-Werte anhand von Rewards. Pfeile zeigen die derzeit bevorzugte Aktion. Exploration verändert die gesammelten Erfahrungen; vergleiche deshalb mehrere Läufe.

🤖0.0
↑0.0
↑0.0
↑0.0
↑0.0
↑0.0
■
■
⚠
↑0.0
↑0.0
↑0.0
↑0.0
↑0.0
↑0.0
↑0.0
⚠
↑0.0
■
↑0.0
↑0.0
↑0.0
↑0.0
↑0.0
🏁
Roboter: aktueller Zustand · Flagge: +10 und Ende · Warnung: −8 und Ende · Quadrat: Wand · Pfeil: beste gelernte Aktion
Exploration ε30%

Hohes ε probiert mehr Aktionen aus. Niedriges ε folgt häufiger den gelernten Q-Werten.

Episoden
0
Schritte
0
Return
0
Lernprotokoll
Q-Werte beginnen bei null. Trainiere Episoden und beobachte, wie sich die Strategie verändert.

Der RL-Loop

1

Agent

Die lernende beziehungsweise entscheidende Instanz.

2

Umgebung

Nimmt Aktionen entgegen und liefert Beobachtungen sowie Rewards.

3

Zustand / Beobachtung

Was der Agent beobachten kann; eventuell nur einen Teil des tatsächlichen Zustands.

4

Aktion

Eine verfügbare Handlung des Agenten.

5

Reward

Ein skalares Lernsignal und keine vollständige Beschreibung der beabsichtigten Aufgabe.

6

Policy

Eine Strategie, die Beobachtungen auf Aktionen abbildet.

Die wichtigsten Methodenfamilien

Q-Learning

Aktualisiert Schätzungen des erwarteten Returns für Zustands-Aktions-Paare.

Policy-Gradienten

Verändern Policy-Parameter mithilfe beobachteter Returns oder Advantage-Schätzungen.

Actor-Critic

Kombiniert eine Policy mit einer gelernten Wertschätzung.

PPO / GRPO

Familien der Policy-Optimierung mit unterschiedlichen Schätzern und Update-Beschränkungen. Die Q-Learning-Demo implementiert diese Verfahren nicht.

Warum RL für moderne KI wichtig ist

RL ist die konzeptionelle Brücke zwischen passiver Vorhersage und agentischem Verhalten. Roboter, spielende Systeme, Empfehlungssysteme, Tool-nutzende Agenten und LLM-Post-Training nutzen alle dieselbe Idee: Entscheidungen anhand von Feedback aus der Welt oder einem Reward-Modell optimieren.

In LLMs nutzen RLHF und neuere Trainingsmethoden mit verifizierbaren Rewards RL-artige Optimierung, um Modelle hilfreicher, sicherer oder besser im Schlussfolgern zu machen. Das Modell imitiert nicht bloß Text; es wird zu Verhalten gedrängt, das höheren Reward erzielt.