Clicked Gallery

O que é um modelo multimodal?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado numa frase

Engineering Notes · AI Systems

The lab's newest multimodal model reads a photograph, a spreadsheet and a spoken question in the same request.

O leitor sublinhou uma palavra na documentação. O Clicked tornou o termo técnico «multimodal model» fácil de entender:

Explicado em três níveis

Os mesmos fatos, outra vibe — Modo slang 😎

O método Clicked

●○○

Overview

Um modelo multimodal é uma IA que lida com mais de um tipo de entrada, como texto, imagens, áudio e vídeo, dentro de um único sistema. É por isso que você pode fotografar uma página e fazer uma pergunta sobre ela no mesmo fôlego. Os modelos anteriores só liam texto, então qualquer outra coisa tinha que ser descrita a eles primeiro.
●○○

Overview

Um modelo multimodal aceita imagens, som e vídeo, não só digitação. É por isso que você pode apontar o celular para algo e perguntar sobre a coisa em si. O tipo antigo sabia ler e nada mais, então você tinha que colocar o mundo em palavras primeiro. 😎

Uma ideia rápida — muitas vezes é tudo de que você precisa.

●●○

Detail

Os modelos mais antigos só liam texto, então qualquer outra coisa tinha que ser descrita em palavras primeiro, e a maioria das coisas não sobrevive a essa tradução. Um modelo multimodal remove essa etapa transformando cada tipo de entrada no mesmo formato interno antes de processar qualquer coisa. Uma frase, uma fotografia e alguns segundos de fala viram, todos, longas listas de números. Uma vez que são números, o modelo os trata do mesmo jeito, e é isso que permite que uma pergunta sobre uma imagem viaje na mesma requisição que a própria imagem. Então uma foto de um recibo ou de uma tela de erro entra direto, e ele pode responder coisas que precisam dos dois ao mesmo tempo, como o que está errado neste gráfico. O custo é tamanho e velocidade, já que imagens e áudio viram muito mais números do que uma frase. Isso corrói a janela de contexto e deixa cada resposta mais lenta e mais cara. Conseguir receber uma entrada não é o mesmo que lidar bem com ela, então um modelo que lê uma página digitada com confiança ainda pode ler errado um diagrama desenhado à mão.
●●○

Detail

Os modelos antigos tinham uma porta de entrada e você era o porteiro: o que você não conseguisse pôr em palavras nunca entrava, e o seu vocabulário era o teto do que a coisa podia saber. O tipo multimodal derrubou a parede. Imagens, som e vídeo são todos derretidos nos mesmos números antes de ele começar a pensar, então uma foto e uma pergunta sobre aquela foto viajam juntas. Aponte o celular para um cardápio em Lisboa e pergunte o que um vegetariano pode pedir com segurança, e ele simplesmente responde. Chegam duas contas por isso. Uma foto devora muito mais da atenção dele do que uma frase, então você queima a janela mais rápido e espera mais. E ver algo não é o mesmo que ver corretamente. O modelo que lê uma página de texto denso sem piscar vai estudar o seu rabisco de quadro branco e descrever com confiança um diagrama que nunca esteve lá. 😎

Quer mais? Um clique aprofunda.

●●●

Analogy

Guiar alguém por um problema de computador pelo telefone. Tudo o que você sabe chega pela descrição da pessoa, então se ela nunca menciona a luz vermelha piscando, a luz não existe no que lhe diz respeito. Fique ao lado da máquina e você mesmo lê o erro, nota o cabo desconectado e ouve o clique. Você não ficou mais inteligente — ganhou acesso a informação que estava lá o tempo todo.
●●●

Analogy

Descrever uma música digitando os três versos que você meio lembra, versus só cantarolá-la no celular. Mesma música, mesmo você, chances absurdamente diferentes de descobrir qual é. Uma rota precisa espremer a coisa inteira pelo seu vocabulário antes de qualquer outra coisa acontecer. A outra deixa a máquina ouvir o barulho de verdade e pular você por completo.

Conceito novo? Um exemplo do dia a dia faz clicar — novas analogias quando quiser.

Explicações de IA podem conter erros · Não é aconselhamento profissional

Definição formal — O mesmo termo, explicado da forma habitual

Um modelo multimodal é um sistema de aprendizado de máquina treinado para aceitar entradas de múltiplos tipos, tipicamente texto, imagens, áudio ou vídeo, projetando cada um num espaço de representação compartilhado que permite o processamento conjunto numa única passagem para a frente. Isso habilita o raciocínio entre modalidades sem descrição textual intermediária, ao custo de maior consumo de tokens, latência e variação de confiabilidade dependente da modalidade.

Quer que o Clicked explique termos como «multimodal model» direto no seu navegador, até em PDFs?

Adicionar ao Chrome — Grátis

50 explicações grátis · Sem cartão de crédito