KI. Verständlich. Praxisnah. Effizient.ki-academy-leipzig.de
← Zurück zum Glossar
KI-GrundlagenBuchstabe R

RLHF

Trainingsverfahren, bei dem menschliche Bewertungen das Modellverhalten an Nutzererwartungen ausrichten.

RLHF (Reinforcement Learning with Human Feedback) kombiniert Reinforcement Learning mit direktem menschlichem Feedback zum Training von KI-Modellen. Statt rein mathematischer Belohnungen erhält das Modell Bewertungen von Menschen und lernt, Antworten zu liefern, die menschlichen Präferenzen entsprechen.

Schritte: Basismodell trainieren → menschliches Feedback sammeln (Bewertung von Ausgaben) → Belohnungsmodell erstellen (menschliche Präferenz in Signale übersetzen) → Modell mit Reinforcement Learning optimieren. Zentrale Technik bei ChatGPT, Claude und anderen modernen LLMs.

Vorteile: verbesserte KI-Qualität und Nützlichkeit, erhöhte Sicherheit (verhindert schädliche Inhalte), Anpassung an spezifische Anforderungen. Herausforderungen: teures menschliches Feedback, mögliche Bias durch Feedback-Geber, Skalierungsprobleme.

Beispiel

Bewerten Testpersonen höfliche und korrekte Antworten besser, lernt das Modell durch RLHF, künftig genau solche zu bevorzugen.

Synonyme

RLHFReinforcement Learning from Human FeedbackReinforcement Learning aus menschlichem Feedback