RLHF
RLHF (Reinforcement Learning with Human Feedback) kombiniert Reinforcement Learning mit direktem menschlichem Feedback zum Training von KI-Modellen. Statt rein mathematischer Belohnungen erhält das Modell Bewertungen von Menschen und lernt, Antworten zu liefern, die menschlichen Präferenzen entsprechen.
Schritte: Basismodell trainieren → menschliches Feedback sammeln (Bewertung von Ausgaben) → Belohnungsmodell erstellen (menschliche Präferenz in Signale übersetzen) → Modell mit Reinforcement Learning optimieren. Zentrale Technik bei ChatGPT, Claude und anderen modernen LLMs.
Vorteile: verbesserte KI-Qualität und Nützlichkeit, erhöhte Sicherheit (verhindert schädliche Inhalte), Anpassung an spezifische Anforderungen. Herausforderungen: teures menschliches Feedback, mögliche Bias durch Feedback-Geber, Skalierungsprobleme.
Beispiel
Bewerten Testpersonen höfliche und korrekte Antworten besser, lernt das Modell durch RLHF, künftig genau solche zu bevorzugen.