Clicked Gallery

¿Qué es un modelo multimodal?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado en una frase

Engineering Notes · AI Systems

The lab's newest multimodal model reads a photograph, a spreadsheet and a spoken question in the same request.

El lector subrayó una palabra en la documentación. Clicked hizo que el término técnico «multimodal model» fuera fácil de entender:

Explicado en tres niveles

Los mismos datos, otro rollo — Modo jerga 😎

El método Clicked

●○○

Overview

Un modelo multimodal es una IA que maneja más de un tipo de entrada, como texto, imágenes, audio y vídeo, dentro de un mismo sistema. Por eso puedes fotografiar una página y preguntar sobre ella en el mismo gesto. Los modelos anteriores solo leían texto, así que todo lo demás había que describírselo primero.
●○○

Overview

Un modelo multimodal puede tomar imágenes, sonido y vídeo, no solo texto escrito. Por eso puedes apuntar el móvil a algo y preguntar por la cosa misma. Los de antes solo sabían leer, así que había que meter el mundo en palabras primero. 😎

Una idea rápida — muchas veces es todo lo que necesitas.

●●○

Detail

Los modelos antiguos solo sabían leer texto, así que cualquier otra cosa había que describirla con palabras primero, y la mayoría de las cosas no sobreviven a esa traducción. Un modelo multimodal elimina ese paso convirtiendo cada tipo de entrada al mismo formato interno antes de procesar nada. Una frase, una fotografía y unos segundos de habla se vuelven todos listas largas de números. Una vez que son números el modelo los trata igual, que es lo que permite que una pregunta sobre una imagen viaje en la misma petición que la imagen. Así una foto de un recibo o de una pantalla de error entra directamente, y puede responder cosas que necesitan ambas, como qué falla en este gráfico. El coste es tamaño y velocidad, ya que las imágenes y el audio se convierten en muchísimos más números que una frase. Eso devora la ventana de contexto y hace cada respuesta más lenta y más cara. Poder aceptar una entrada no es lo mismo que manejarla bien, así que un modelo que lee una página mecanografiada con fiabilidad puede aun así malinterpretar un diagrama dibujado a mano.
●●○

Detail

Los modelos antiguos tenían una sola puerta de entrada y tú eras el portero, así que lo que no supieras poner en palabras nunca entraba, y tu vocabulario era el techo de lo que aquello podía saber. Los multimodales tiraron la pared. Fotos, sonido y vídeo se funden en los mismos números antes de que empiece a pensar, así que una foto y una pregunta sobre esa foto viajan juntas. Apunta el móvil al menú de un restaurante en Lisboa y pregunta qué puede pedir un vegetariano sin riesgo, y simplemente responde. Por esto llegan dos facturas. Una foto devora mucha más de su capacidad de atención que una frase, así que agotas la ventana antes y esperas más. Y ver algo no es lo mismo que verlo bien. El modelo que lee una página densa sin pestañear estudiará tu garabato de pizarra y describirá con total seguridad un diagrama que nunca estuvo ahí. 😎

¿Quieres más? Un clic profundiza.

●●●

Analogy

Guiar a alguien por teléfono para arreglar un ordenador. Todo lo que sabes llega a través de su descripción, así que si nunca menciona la luz roja parpadeante, para ti no existe. Ponte al lado de la máquina y lees el error tú mismo, ves el cable desenchufado y oyes el chasquido. No te volviste más listo, ganaste acceso a información que estaba ahí todo el tiempo.
●●●

Analogy

Describir una canción tecleando las tres frases que medio recuerdas, frente a tararearla al móvil. Misma canción, mismo tú, probabilidades radicalmente distintas de que te digan cuál es. Una vía tiene que exprimir todo aquello a través de tu vocabulario antes de que pase nada más. La otra deja que la máquina oiga el ruido de verdad.

¿Concepto nuevo? Un ejemplo cotidiano lo hace clic — nuevas analogías cuando quieras.

Las explicaciones de IA pueden contener errores · No es asesoramiento profesional

Definición formal — El mismo término, explicado de la forma habitual

Un modelo multimodal es un sistema de aprendizaje automático entrenado para aceptar entradas de múltiples tipos, típicamente texto, imágenes, audio o vídeo, proyectando cada una en un espacio de representación compartido que permite el procesamiento conjunto en una sola pasada. Esto habilita el razonamiento entre modalidades sin descripción textual intermedia, a costa de mayor consumo de tokens, latencia y variación de fiabilidad según la modalidad.

¿Quieres que Clicked te explique términos como «multimodal model» directamente en tu navegador, incluso en PDFs?

Añadir a Chrome — Gratis

50 Explicaciones gratis · Sin tarjeta de crédito