Lernen aus Konsequenzen
Reinforcement Learning trainiert einen Agenten durch Interaktion. Statt für jedes Beispiel die richtige Antwort gezeigt zu bekommen, probiert der Agent Aktionen aus, erhält Belohnungen und lernt nach und nach eine Policy, die bessere langfristige Ergebnisse erzeugt.
Q-Learning im Gitter
Der Agent aktualisiert Q-Werte anhand von Rewards. Pfeile zeigen die derzeit bevorzugte Aktion. Exploration verändert die gesammelten Erfahrungen; vergleiche deshalb mehrere Läufe.
Hohes ε probiert mehr Aktionen aus. Niedriges ε folgt häufiger den gelernten Q-Werten.
Der RL-Loop
Agent
Die lernende beziehungsweise entscheidende Instanz.
Umgebung
Nimmt Aktionen entgegen und liefert Beobachtungen sowie Rewards.
Zustand / Beobachtung
Was der Agent beobachten kann; eventuell nur einen Teil des tatsächlichen Zustands.
Aktion
Eine verfügbare Handlung des Agenten.
Reward
Ein skalares Lernsignal und keine vollständige Beschreibung der beabsichtigten Aufgabe.
Policy
Eine Strategie, die Beobachtungen auf Aktionen abbildet.
Die wichtigsten Methodenfamilien
Q-Learning
Aktualisiert Schätzungen des erwarteten Returns für Zustands-Aktions-Paare.
Policy-Gradienten
Verändern Policy-Parameter mithilfe beobachteter Returns oder Advantage-Schätzungen.
Actor-Critic
Kombiniert eine Policy mit einer gelernten Wertschätzung.
PPO / GRPO
Familien der Policy-Optimierung mit unterschiedlichen Schätzern und Update-Beschränkungen. Die Q-Learning-Demo implementiert diese Verfahren nicht.
Warum RL für moderne KI wichtig ist
RL ist die konzeptionelle Brücke zwischen passiver Vorhersage und agentischem Verhalten. Roboter, spielende Systeme, Empfehlungssysteme, Tool-nutzende Agenten und LLM-Post-Training nutzen alle dieselbe Idee: Entscheidungen anhand von Feedback aus der Welt oder einem Reward-Modell optimieren.
In LLMs nutzen RLHF und neuere Trainingsmethoden mit verifizierbaren Rewards RL-artige Optimierung, um Modelle hilfreicher, sicherer oder besser im Schlussfolgern zu machen. Das Modell imitiert nicht bloß Text; es wird zu Verhalten gedrängt, das höheren Reward erzielt.