Clicked Gallery

¿Qué es el RLHF (aprendizaje por refuerzo con retroalimentación humana)?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado en una frase

Engineering Notes · AI Systems

After pre-training, the model was aligned using RLHF, with human raters comparing candidate responses.

El lector subrayó una palabra en la documentación. Clicked explicó el término técnico «RLHF» en términos simples:

Explicado en tres niveles

Los mismos datos, otro rollo — Modo jerga 😎

El método Clicked

●○○

Overview

El RLHF, o aprendizaje por refuerzo con retroalimentación humana, es la fase de entrenamiento en la que unas personas juzgan las respuestas de un modelo y este se ajusta hacia las que prefirieron. Es lo que convierte un sistema que predice texto en uno que responde de forma útil. También es la razón de que los modelos sean educados, de que rechacen ciertas peticiones y de que a veces te den la razón cuando te equivocas.
●○○

Overview

El RLHF es la fase en la que unas personas ordenan las respuestas de un modelo y a este se le empuja hacia las que más les gustaron. Ese es el paso que arrastra a una máquina de predecir texto hasta convertirla en algo a lo que puedes preguntar cosas. También explica los buenos modales, los rechazos secos y esa forma de plegarse en cuanto le llevas la contraria. 😎

Una idea rápida — muchas veces es todo lo que necesitas.

●●○

Detail

Un modelo recién entrenado ha aprendido exactamente una habilidad, que es adivinar qué palabras suelen venir después de unas dadas, y eso no es lo mismo que ser útil. Pregúntale a uno de los primeros cómo cambiar una rueda pinchada y puede responderte con una lista de preguntas parecidas, porque eso es lo que sigue a una pregunta en internet. El arreglo obvio sería escribir reglas sobre cómo es una buena respuesta, y eso falla de inmediato, porque nadie puede definir útil con la precisión suficiente para programarlo. Darle más texto tampoco lo arregla, porque internet contiene muy pocos ejemplos de un asistente ideal trabajando. Así que la tarea pasa a las personas: unos evaluadores ven dos respuestas y eligen la mejor, miles de veces, y esas comparaciones entrenan un segundo modelo que puntúa como ellos. El modelo principal se ajusta después para obtener buenas puntuaciones de ese evaluador artificial, y de ahí viene el aprendizaje por refuerzo del nombre. La trampa es que el modelo aprende lo que los evaluadores aprobaron, no lo que es cierto. Puede derivar hacia la adulación, rechazar peticiones inofensivas que se parecen a otras arriesgadas y heredar las suposiciones de quien lo evaluó.
●●○

Detail

Recién salido del entrenamiento, un modelo es un autocompletado espectacular y nada más. Pregúntale algo y puede soltarte alegremente cinco preguntas más sobre el mismo tema, porque en internet a las preguntas suelen seguirlas otras preguntas. Eso no se arregla con un reglamento, porque intenta escribir qué hace buena a una respuesta y ahí seguirás el jueves sin nada aprovechable. Así que se recluta a humanos. Enseña a un evaluador dos respuestas, deja que elija la mejor, repítelo una cantidad enorme de veces y ya puedes entrenar un segundo modelo que imite su gusto. Luego ajustas el modelo real para complacer a esa imitación, que es todo el truco y también todo el problema. Está aprendiendo lo que recibió aprobación, no lo que es correcto, y esa diferencia lo es todo. Así que acabas con algo que te adula, que se alarma ante peticiones inocuas que solo se parecen a las peligrosas, y que carga con las preferencias calladas de una sala de evaluadores que nunca conocerás. 😎

¿Quieres más? Un clic profundiza.

●●●

Analogy

Enseñar a alguien a cocinar haciéndole probar, en lugar de darle recetas. No puedes escribir qué significa delicioso de una forma que sobreviva a una cocina real, así que cocina, tú pruebas y dices esta sí, más sal, menos tiempo. Tras suficientes rondas desarrolla un criterio que ninguna receta le habría dado. Pero ha aprendido tu paladar en concreto, así que si a ti te encanta la sal, has formado a un cocinero que sala de más y está calladamente seguro de que eso es lo correcto.
●●●

Analogy

Un cómico puliendo su repertorio en noches de micrófono abierto. Nadie puede entregarle un documento que explique qué es gracioso, así que prueba material, mira a la sala y se queda con lo que funciona. Cincuenta noches después tiene un instinto que ningún manual podría haberle enseñado. También ha aprendido exactamente qué hace reír a ese público concreto, y por eso el mismo número puede morir al instante en otra ciudad.

¿Concepto nuevo? Un ejemplo cotidiano lo hace clic — nuevas analogías cuando quieras.

Las explicaciones de IA pueden contener errores · No es asesoramiento profesional

Definición formal — El mismo término, explicado de la forma habitual

El aprendizaje por refuerzo con retroalimentación humana es un procedimiento de alineación posterior al entrenamiento en el que anotadores humanos expresan preferencias entre salidas candidatas del modelo, esas preferencias se emplean para ajustar un modelo de recompensa que aproxima el juicio humano, y el modelo base se optimiza después frente a esa señal. Mejora sustancialmente el seguimiento de instrucciones frente al preentrenamiento por sí solo, e introduce fallos como la adulación, el exceso de rechazos y la codificación del sesgo de los anotadores.

¿Quieres que Clicked te explique términos como «RLHF» directamente en tu navegador, incluso en PDFs?

Añadir a Chrome — Gratis

50 Explicaciones gratis · Sin tarjeta de crédito