Clicked Gallery

O que é um grande modelo de linguagem (LLM)?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado numa frase

Engineering Notes · AI Systems

The system is built on a large language model trained on several trillion words of text.

O leitor sublinhou uma palavra na documentação. O Clicked explicou o termo técnico «large language model» em termos simples:

Explicado em três níveis

Os mesmos fatos, outra vibe — Modo slang 😎

O método Clicked

●○○

Overview

Um grande modelo de linguagem (LLM) é um programa que prevê o texto que vem a seguir. Ele é construído em duas etapas. O pré-treinamento lê uma quantidade enorme de escrita até esses chutes ficarem bons. Sozinho, isso produz algo que continua a sua frase em vez de respondê-la. Uma segunda etapa o ensina a responder perguntas. As duas etapas terminam muito antes de você digitar qualquer coisa nele.
●○○

Overview

Tire a mística e um LLM é um chutador de próxima palavra com um hábito de leitura descomunal. Deixado assim, ele continuaria alegremente escrevendo de onde você parou e nunca responderia você. Uma segunda etapa de treinamento, com humanos sentados escolhendo a melhor de duas réplicas, foi o que transformou o divagador em algo que responde. 😎

Uma ideia rápida — muitas vezes é tudo de que você precisa.

●●○

Detail

Tudo o que um LLM faz repousa numa operação repetida sem parar: olhar o texto até aqui, produzir o próximo pedaço mais provável. Digite "a capital da França é" e ele responde Paris, porque esse padrão apareceu constantemente no que ele leu — não porque checou uma fonte. Sozinho, isso só lhe dá uma máquina que continua escrevendo de onde você parou. A segunda etapa, o aprendizado por reforço com feedback humano, põe pessoas ranqueando respostas concorrentes até ele aprender a responder em vez de divagar. Por que não construir um banco de dados de respostas? Porque um banco de dados devolve só o que alguém colocou nele, e a previsão dá conta das perguntas que ninguém pensou em escrever. O custo é que soar certo e estar certo são habilidades separadas, então ele pode descrever eventos que nunca aconteceram. Ele também parece lembrar de você, por dois mecanismos separados. Dentro de um chat, a conversa inteira é reenviada toda vez que você aperta enter, enchendo a janela de contexto. Entre chats, produtos como o ChatGPT guardam anotações sobre você em armazenamento comum e as colam depois. De um jeito ou de outro, ele recebe um lembrete em vez de recordar qualquer coisa.
●●○

Detail

Um LLM leu uma quantidade absurda de texto e aprendeu o que tende a seguir o quê. A versão crua de um, porém, é genuinamente inútil. Faça uma pergunta e ele pode replicar com mais três perguntas, porque isso é uma coisa perfeitamente normal de se achar depois de uma pergunta por aí. Alguém teve que atravessar milhares de pares de respostas marcando qual era melhor, e é daí que veio o assistente educado. Então ele não é um buscador e não está consultando nada — por isso pode lhe entregar uma citação que nunca existiu e soar animadíssimo com ela. O lance da memória também pega as pessoas. Dentro de um chat ele parece lembrar porque a conversa inteira é postada de volta para ele a cada mensagem. Entre chats, o aplicativo guarda anotações sobre você num arquivo em algum lugar e as desliza no topo do próximo. Nenhum dos dois é o modelo lembrando. Ele recebe um lembrete e o lê como qualquer outra coisa que você cola. E é por isso que apagar essas anotações salvas zera a relação na hora. 😎

Quer mais? Um clique aprofunda.

●●●

Analogy

O texto preditivo do seu celular faz uma versão minúscula disso. Digite "até" e ele oferece "amanhã", porque é o que normalmente veio depois nas mensagens que ele viu. Um grande modelo de linguagem é essa ideia com muitíssimo mais leitura por trás e uma visão bem mais longa do que veio antes. O salto de escala é o que transforma um chute de próxima palavra em algo que sustenta uma conversa.
●●●

Analogy

Alguém que leu todos os livros de culinária já escritos e nunca cozinhou uma vez. Pergunte o que combina com cordeiro e a resposta é excelente, porque essa frase foi escrita dez mil vezes. Pergunte se o seu cordeiro específico está no ponto e você recebe uma resposta igualmente confiante — entregue de uma cadeira, em outro prédio. 😎

Conceito novo? Um exemplo do dia a dia faz clicar — novas analogias quando quiser.

Explicações de IA podem conter erros · Não é aconselhamento profissional

Definição formal — O mesmo termo, explicado da forma habitual

Um grande modelo de linguagem é uma rede neural treinada num grande corpus para prever tokens subsequentes a partir dos anteriores, com contagens de parâmetros tipicamente na casa dos bilhões. O pré-treinamento nesse objetivo produz um sistema de continuação de texto; o ajuste fino em exemplos de instrução e o aprendizado por reforço com feedback humano são aplicados depois para produzir o comportamento de assistente. Os parâmetros permanecem fixos na inferência, e qualquer recordação aparente dentro de uma sessão deriva de a conversa ser refornecida na janela de contexto.

Quer que o Clicked explique termos como «large language model» direto no seu navegador, até em PDFs?

Adicionar ao Chrome — Grátis

50 explicações grátis · Sem cartão de crédito