Clicked Gallery

Was ist RLHF (bestärkendes Lernen aus menschlichem Feedback)?

Markiert in einem echten Engineering-Dokument. Erklärt von Clicked.

Im Satz verwendet

Engineering Notes · AI Systems

After pre-training, the model was aligned using RLHF, with human raters comparing candidate responses.

Der Leser markierte ein Wort in der Dokumentation. Clicked erklärte den Fachbegriff „RLHF“ ganz einfach:

In drei Stufen erklärt

Gleiche Fakten, anderer Vibe — Slang-Modus 😎

Die Clicked-Methode

●○○

Overview

RLHF, also bestärkendes Lernen aus menschlichem Feedback, ist der Trainingsschritt, in dem Menschen die Antworten eines Modells beurteilen und das Modell in Richtung der bevorzugten Antworten angepasst wird. Das macht aus einem System, das Text vorhersagt, eines, das hilfreich antwortet. Es ist auch der Grund, warum Modelle höflich sind, warum sie bestimmte Anfragen ablehnen und warum sie dir manchmal zustimmen, obwohl du falsch liegst.
●○○

Overview

RLHF ist die Phase, in der Menschen die Antworten eines Modells sortieren und es zu dem hingeschoben wird, was ihnen am besten gefiel. Dieser Schritt zerrt eine Textvorhersagemaschine dahin, dass man sie tatsächlich etwas fragen kann. Er erklärt auch die guten Manieren, die schroffen Absagen und dieses Einknicken, sobald du widersprichst. 😎

Die Kurzfassung — oft reicht sie schon.

●●○

Detail

Ein frisch trainiertes Modell hat genau eine Fähigkeit gelernt, nämlich aus einigen Wörtern zu erraten, welche üblicherweise folgen, und das ist nicht dasselbe wie nützlich zu sein. Frag ein frühes Modell, wie man einen platten Reifen wechselt, und es antwortet vielleicht mit einer Liste ähnlich klingender Fragen, denn genau das folgt online oft auf eine Frage. Die naheliegende Reparatur wäre, Regeln dafür zu schreiben, wie eine gute Antwort aussieht, und das scheitert sofort, weil niemand hilfreich präzise genug definieren kann, um es zu programmieren. Mehr Text hilft ebenfalls nicht, denn das Internet enthält kaum Beispiele eines idealen Assistenten bei der Arbeit. Also übernehmen Menschen: Bewertern werden zwei Antwortkandidaten gezeigt, sie wählen den besseren, tausendfach, und diese Vergleiche trainieren ein zweites Modell, das Antworten so bewerten lernt wie die Bewerter. Das Hauptmodell wird anschließend darauf feinabgestimmt, bei diesem Bewerter hohe Punktzahlen zu erzielen, und daher stammt das bestärkende Lernen im Namen. Der Haken ist, dass das Modell lernt, was die Bewerter gutgeheißen haben, nicht was wahr ist. Es kann zu Schmeichelei neigen, harmlose Anfragen ablehnen, die riskanten nur ähneln, und still die Annahmen der Bewerter übernehmen.
●●○

Detail

Frisch aus dem Training ist ein Modell eine spektakuläre Autovervollständigung und sonst nichts. Frag es etwas, und es liefert womöglich fröhlich fünf weitere Fragen zum selben Thema, denn online folgen auf Fragen häufig andere Fragen. Mit einem Regelwerk ist das nicht zu beheben, denn versuch mal aufzuschreiben, was eine Antwort gut macht, und du sitzt bis Donnerstag da und hast nichts Brauchbares. Also werden Menschen eingespannt. Zeig einem Bewerter zwei Antworten, lass ihn die bessere wählen, mach das enorm oft, und du kannst ein zweites Modell darauf trainieren, seinen Geschmack nachzuahmen. Dann stimmst du das echte Modell darauf ab, dieser Nachahmung zu gefallen, was der ganze Trick und zugleich das ganze Problem ist. Es lernt, was Zustimmung bekam, nicht was richtig ist. Du bekommst also etwas, das dir schmeichelt, bei harmlosen Anfragen in Panik gerät, die gefährlichen nur ähneln, und die stillen Vorlieben eines Raums voller Bewerter mitträgt, die du nie treffen wirst. 😎

Mehr? Ein Klick geht tiefer.

●●●

Analogy

Jemandem Kochen beibringen, indem er probiert, statt ihm Rezepte zu geben. Man kann nicht aufschreiben, was köstlich bedeutet, so dass es eine echte Küche übersteht, also kocht er, du probierst und sagst dieses hier, mehr Salz, kürzer. Nach genug Runden hat er ein Urteilsvermögen, das kein Rezept hätte geben können. Aber er hat deinen Gaumen gelernt, wenn du also Salz liebst, hast du einen Koch ausgebildet, der übersalzt und still überzeugt ist, dass genau das richtig ist.
●●●

Analogy

Ein Comedian, der sein Programm bei offenen Bühnen ausarbeitet. Niemand kann ihm ein Dokument reichen, das erklärt, was komisch ist, also probiert er Material aus, beobachtet den Raum und behält, was zündet. Fünfzig Abende später hat er Instinkte, die ihm kein Handbuch je hätte beibringen können. Er hat außerdem genau gelernt, was dieses eine Publikum zum Lachen bringt, und deshalb kann dieselbe Nummer in einer anderen Stadt sofort sterben.

Neues Konzept? Ein Alltagsbeispiel macht’s greifbar — neue Analogien auf Knopfdruck.

KI-Erklärungen können Fehler enthalten · Keine professionelle Beratung

Formale Definition — Derselbe Begriff, wie er sonst erklärt wird

Bestärkendes Lernen aus menschlichem Feedback ist ein Ausrichtungsverfahren nach dem Vortraining, bei dem menschliche Annotatoren Präferenzen zwischen Ausgabekandidaten äußern, diese Präferenzen ein Belohnungsmodell anpassen, das menschliches Urteil approximiert, und das Basismodell anschließend gegen dieses Signal optimiert wird. Es verbessert die Befolgung von Anweisungen gegenüber reinem Vortraining erheblich und führt zugleich Fehlermodi wie Schmeichelei, übermäßige Verweigerung und die Kodierung von Bewerterverzerrungen ein.

Soll Clicked Begriffe wie „RLHF“ direkt in deinem Browser erklären – auch in PDFs?

Zu Chrome hinzufügen — Kostenlos

50 kostenlose Erklärungen · Keine Kreditkarte nötig