Technik

RLHF (Reinforcement Learning from Human Feedback)

RLHF ist ein Trainingsverfahren, bei dem Menschen KI-Ausgaben bewerten und das Modell lernt, menschliche Präferenzen zu maximieren. OpenAI nutzte RLHF, um ChatGPT hilfreicher und sicherer zu machen. Das Verfahren ist entscheidend dafür, dass moderne Sprachmodelle nützliche und angemessene Antworten geben.

Was ist RLHF?

RLHF (Reinforcement Learning from Human Feedback, deutsch: verstärkendes Lernen aus menschlichem Feedback) ist ein Trainingsverfahren, das rohe Sprachmodelle in hilfreiche, sichere Assistenten verwandelt. Menschen bewerten dabei Modellantworten, und das Modell lernt über Reinforcement Learning, Antworten zu erzeugen, die menschlichen Präferenzen entsprechen. RLHF war der entscheidende Durchbruch hinter ChatGPT: Erst dieses Verfahren machte aus einem reinen Text-Vervollständiger einen Assistenten, der Anweisungen befolgt, höflich bleibt und schädliche Anfragen ablehnt.

Wie funktioniert RLHF?

Das klassische RLHF-Verfahren läuft in drei Stufen ab:

  • 1. Supervised Fine-Tuning (SFT): Das vortrainierte Basismodell wird zunächst mit von Menschen geschriebenen Beispiel-Dialogen feinabgestimmt, um das grundlegende Assistenten-Verhalten zu lernen
  • 2. Reward-Modell trainieren: Menschliche Bewerter erhalten mehrere Antworten des Modells auf dieselbe Frage und ordnen sie nach Qualität ("Antwort A ist besser als B"). Aus tausenden solcher Vergleiche wird ein separates Reward-Modell trainiert, das menschliche Präferenzen vorhersagen kann
  • 3. RL-Optimierung: Das Sprachmodell generiert Antworten, das Reward-Modell bewertet sie automatisch, und ein RL-Algorithmus (klassisch PPO) passt das Sprachmodell so an, dass es höhere Bewertungen erzielt
  • Das Reward-Modell ersetzt dabei den Menschen als Dauerbewerter — so lässt sich das Feedback von einigen tausend menschlichen Urteilen auf Milliarden von Trainingsschritten skalieren.

    Warum ist RLHF so wichtig?

  • Hilfsbereitschaft: Modelle lernen, Anweisungen tatsächlich zu befolgen statt nur Text fortzusetzen
  • Sicherheit: Schädliche, beleidigende oder gefährliche Ausgaben werden systematisch abtrainiert
  • Tonalität: Höflichkeit, Struktur und angemessene Ausführlichkeit entstehen maßgeblich durch RLHF
  • Alignment: RLHF ist bis heute das wichtigste praktische Werkzeug, um KI-Verhalten an menschlichen Werten auszurichten
  • Grenzen und Weiterentwicklungen

    RLHF hat bekannte Schwächen: Es ist teuer (viele menschliche Bewertungen nötig), die Bewerter bringen eigene Vorurteile mit, und Modelle können lernen, gefällig statt korrekt zu antworten — sie sagen, was Menschen hören wollen (Sycophancy), oder wirken übertrieben vorsichtig. Deshalb gibt es Weiterentwicklungen:

  • DPO (Direct Preference Optimization): Vereinfachtes Verfahren, das Präferenzdaten direkt ohne separates Reward-Modell nutzt
  • RLAIF / Constitutional AI: KI-Feedback ersetzt teilweise menschliches Feedback — das Modell bewertet Antworten anhand definierter Prinzipien, wie es Anthropic für Claude einsetzt
  • RL mit verifizierbaren Belohnungen (RLVR): Bei Mathematik und Code wird nicht menschliches Urteil, sondern die objektive Korrektheit der Lösung belohnt — die Grundlage moderner Reasoning-Modelle

Bedeutung für die Praxis

Für Anwender ist RLHF der unsichtbare Grund, warum sich moderne KI-Assistenten so unterschiedlich "anfühlen": Der Charakter, die Hilfsbereitschaft und die Sicherheitsgrenzen eines Modells sind großteils das Ergebnis dieser Feedback-Phase. Wer KI-Tools vergleicht, vergleicht also nicht nur Modellgröße und Wissen, sondern vor allem die Qualität des Feinschliffs durch menschliches Feedback.

Passende KI-Tools

Diese KI-Tools stehen in direktem Zusammenhang mit dem Begriff RLHF (Reinforcement Learning from Human Feedback):