Clicked Gallery

O que é RLHF (aprendizado por reforço com feedback humano)?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado numa frase

Engineering Notes · AI Systems

After pre-training, the model was aligned using RLHF, with human raters comparing candidate responses.

O leitor sublinhou uma palavra na documentação. O Clicked explicou o termo técnico «RLHF» em termos simples:

Explicado em três níveis

Os mesmos fatos, outra vibe — Modo slang 😎

O método Clicked

●○○

Overview

RLHF, ou aprendizado por reforço com feedback humano, é a etapa de treinamento em que pessoas julgam as respostas de um modelo e o modelo é ajustado na direção das que elas preferiram. É o que transforma um sistema que prevê texto num que responde perguntas de forma útil. É também por que os modelos são educados, por que recusam certos pedidos, e por que às vezes concordam com você quando você está errado.
●○○

Overview

RLHF é o estágio em que pessoas ranqueiam as respostas de um modelo e ele é empurrado na direção do que elas mais gostaram. É a etapa que arrasta uma máquina de prever texto até virar algo a que você consegue de fato perguntar coisas. Também explica os bons modos, as recusas secas, e o jeito como ele se dobra no segundo em que você contesta. 😎

Uma ideia rápida — muitas vezes é tudo de que você precisa.

●●○

Detail

Um modelo recém-treinado aprendeu exatamente uma habilidade: dadas algumas palavras, adivinhar quais palavras costumam vir depois. Isso não é o mesmo que ser útil. Pergunte a um dos primeiros como trocar um pneu furado e ele pode responder com uma lista de perguntas parecidas, porque é isso que muitas vezes segue uma pergunta na internet. Escrever regras para o que é uma boa resposta falha de cara, já que ninguém consegue definir útil com precisão suficiente para codificar, e mais texto não ajuda, porque a internet tem poucos exemplos de um assistente ideal. Então o trabalho vai para pessoas. Avaliadores escolhem a melhor entre duas respostas candidatas, milhares de vezes, e essas escolhas treinam um segundo modelo para pontuar respostas do jeito que eles pontuaram. O modelo principal é então ajustado para ganhar notas altas desse avaliador. O porém é que ele aprende o que os avaliadores aprovaram, não o que é verdade — então pode derivar para a bajulação, recusar pedidos inofensivos que apenas se parecem com arriscados, e herdar as suposições de quem quer que tenha avaliado.
●●○

Detail

Saído direto do treinamento, um modelo é um autocompletar espetacular e nada mais. Pergunte algo e ele pode alegremente produzir mais cinco perguntas sobre o mesmo tema, porque online, perguntas são frequentemente seguidas de outras perguntas. Você não conserta isso com um livro de regras, porque tente escrever exatamente o que torna uma resposta boa e você fica ali até quinta-feira sem nada utilizável. Então humanos são convocados. Mostre a um avaliador duas respostas, deixe-o escolher a melhor, faça isso um número enorme de vezes, e você consegue treinar um segundo modelo para imitar o gosto dele. Depois você afina o modelo de verdade para agradar essa imitação — que é o truque inteiro e também o problema inteiro. Ele está aprendendo o que foi aprovado, não o que é correto. Então você acaba com algo que bajula você e entra em pânico com pedidos inofensivos que apenas se parecem com perigosos. 😎

Quer mais? Um clique aprofunda.

●●●

Analogy

Ensinar alguém a cozinhar fazendo-o provar, em vez de entregar receitas. Você não consegue escrever o que delicioso significa de um jeito que sobreviva ao contato com uma cozinha real, então em vez disso a pessoa cozinha, você prova, e diz este aqui, mais sal, menos tempo. Depois de rodadas suficientes ela desenvolve um julgamento que receita nenhuma teria dado. Mas ela aprendeu o seu paladar especificamente — então se por acaso você ama sal, você treinou um cozinheiro que salga demais e tem a certeza silenciosa de que está correto.
●●●

Analogy

Um comediante lapidando o repertório em noites de microfone aberto. Ninguém consegue entregar a ele um documento explicando o que é engraçado, então ele testa material, observa a plateia e guarda o que funciona. Cinquenta noites depois ele tem instintos que manual nenhum ensinaria. Ele também aprendeu exatamente o que faz aquela plateia específica rir — e é por isso que o show pode morrer na hora numa cidade diferente.

Conceito novo? Um exemplo do dia a dia faz clicar — novas analogias quando quiser.

Explicações de IA podem conter erros · Não é aconselhamento profissional

Definição formal — O mesmo termo, explicado da forma habitual

O aprendizado por reforço com feedback humano é um procedimento de alinhamento pós-treinamento no qual anotadores humanos expressam preferências entre saídas candidatas do modelo, essas preferências são usadas para ajustar um modelo de recompensa que aproxima o julgamento humano, e o modelo base é então otimizado contra esse sinal de recompensa. Ele melhora substancialmente o seguimento de instruções e a qualidade das respostas em relação ao pré-treinamento sozinho, enquanto introduz modos de falha que incluem bajulação, recusa excessiva e a codificação do viés dos anotadores.

Quer que o Clicked explique termos como «RLHF» direto no seu navegador, até em PDFs?

Adicionar ao Chrome — Grátis

50 explicações grátis · Sem cartão de crédito