Clicked Gallery

O que é quantização?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado numa frase

Engineering Notes · AI Systems

The 4-bit quantization cut memory use enough to run the model on a single consumer GPU.

O leitor sublinhou uma palavra na documentação. O Clicked explicou o termo técnico «quantization» em termos simples:

Explicado em três níveis

Os mesmos fatos, outra vibe — Modo slang 😎

O método Clicked

●○○

Overview

A quantização encolhe um modelo de IA guardando os números dele com menos precisão. Cada número ocupa menos memória, então o modelo roda em hardware menor e mais barato. Bem feita, a qualidade quase não cai.
●○○

Overview

Quantização é colocar um modelo de dieta: mesmo cérebro, números guardados de forma mais relaxada. Metade ou um quarto da memória, e ele mal percebe. 😎

Uma ideia rápida — muitas vezes é tudo de que você precisa.

●●○

Detail

Um modelo é bilhões de números, chamados pesos, normalmente guardados a 16 bits cada. A quantização os recodifica a 8 ou 4 bits, então um modelo de 70 bilhões de pesos cai de cerca de 140 gigabytes para uns 35 a 4 bits. A versão completa não cabe nem numa GPU de data center, enquanto a encolhida se espreme numa única placa de vídeo topo de linha de consumidor. O truque funciona porque os pesos se aglomeram em faixas estreitas, então uma escala grosseira bem escolhida perde pouco: as notas em benchmarks tipicamente caem uns poucos por cento a 8 bits e seguem utilizáveis a 4. Abaixo disso a coisa fica feia, e versões de 2 bits costumam ser visivelmente piores. A velocidade normalmente melhora também: a parte lenta de rodar um modelo é buscar todos esses números na memória, e números menores significam menos para buscar. Essa é a principal razão de a IA local existir, deixando as pessoas rodarem os modelos de fronteira de ontem em hardware de jogos.
●●○

Detail

Um modelo é só bilhões de números, e os de fábrica queimam 16 bits por número. Requantize a 4 bits e um modelo 70B encolhe de uns 140 GB para uns 35, que é a linha entre não caber numa GPU de data center e rodar no seu PC gamer. Os números se amontoam em faixas apertadas de qualquer jeito, então o arredondamento grosseiro custa surpreendentemente pouco: uns poucos por cento nos benchmarks a 8 bits, ainda sólido a 4. Force até 2 bits e as rodas começam a bambear. Bônus: normalmente roda mais rápido, já que a parte lenta é buscar os números, não processá-los. Esse truque sozinho é basicamente o motivo de a IA local ser um hobby em vez de uma fantasia. 😎

Quer mais? Um clique aprofunda.

●●●

Analogy

Encolher uma foto para enviar. O arquivo original é enorme; salvá-lo numa qualidade menor deixa o arquivo com um décimo do tamanho, e na tela do celular ninguém percebe. Dê zoom o bastante e você acha os borrões, mas para o dia a dia a imagem cumpre o papel.
●●●

Analogy

MP3. Ninguém guarda álbuns como arquivos crus de estúdio; você fica com um décimo dos dados e os seus fones não notam a diferença. Audiófilos juram que ouvem a perda, testes cegos dizem que mal, e enquanto isso a biblioteca inteira cabe no seu bolso.

Conceito novo? Um exemplo do dia a dia faz clicar — novas analogias quando quiser.

Explicações de IA podem conter erros · Não é aconselhamento profissional

Definição formal — O mesmo termo, explicado da forma habitual

A quantização mapeia os parâmetros do modelo de representações de ponto flutuante de maior precisão para formatos de menor largura de bits, reduzindo a pegada de memória e os requisitos de largura de banda na inferência. A quantização pós-treinamento e o treinamento consciente de quantização trocam custo de implementação por retenção de acurácia, com degradação geralmente modesta a 8 bits e crescentemente significativa abaixo de 4 bits.

Quer que o Clicked explique termos como «quantization» direto no seu navegador, até em PDFs?

Adicionar ao Chrome — Grátis

50 explicações grátis · Sem cartão de crédito