Reinforcement Learning
Reinforcement Learning (RL) ist eine ML-Methode, bei der ein Agent durch Interaktion mit einer Umgebung lernt. Der Agent erhält Belohnungen für richtige Entscheidungen und Strafen für falsche und lernt so, kumulative Belohnungen zu maximieren. Grundprinzipien: Agent, Umgebung, Belohnung, Ziel.
Schlüsselkonzepte: Policy (Strategie des Agenten), Wertfunktion (bewertet Zustände langfristig), Q-Learning (bewertet Aktionen in Zuständen), Exploration vs. Exploitation (Neues erkunden vs. bekanntes Wissen nutzen). Modellierung als Markov-Entscheidungsprozess (MDP).
Anwendungen: Spieleagenten (AlphaGo, AlphaZero), Robotersteuerung, autonomes Fahren, Ressourcenoptimierung, RLHF (Reinforcement Learning with Human Feedback für LLMs). RL hat bahnbrechende Ergebnisse in komplexen Entscheidungsproblemen erzielt.
Beispiel
Ein System lernt das Steuern eines Roboterarms, indem erfolgreiche Bewegungen belohnt und Fehlgriffe bestraft werden.