Clicked Gallery

¿Qué es un gran modelo de lenguaje (LLM)?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado en una frase

Engineering Notes · AI Systems

The system is built on a large language model trained on several trillion words of text.

El lector subrayó una palabra en la documentación. Clicked explicó el término técnico «large language model» en términos simples:

Explicado en tres niveles

Los mismos datos, otro rollo — Modo jerga 😎

El método Clicked

●○○

Overview

Un gran modelo de lenguaje (LLM) es un programa que predice qué texto viene a continuación. Se construye en dos etapas. El preentrenamiento lee una cantidad enorme de texto hasta que esas predicciones son buenas. Eso por sí solo produce algo que continúa tu frase en lugar de responderla. Una segunda etapa le enseña a responder preguntas, y ambas terminan mucho antes de que tú escribas nada.
●○○

Overview

Quítale el misterio y un LLM es un adivinador de la siguiente palabra con un hábito de lectura desmedido. Tal cual seguiría escribiendo alegremente desde donde tú lo dejaste sin responderte jamás. Una segunda etapa de entrenamiento, con humanos ahí sentados eligiendo cuál de dos respuestas era mejor, es lo que convirtió al divagador en algo que contesta. 😎

Una idea rápida — muchas veces es todo lo que necesitas.

●●○

Detail

Todo lo que hace un LLM se apoya en una sola operación repetida sin parar: mirar el texto que hay hasta ahora y producir la continuación más probable. Escribe «la capital de Francia es» y responde París, porque ese patrón apareció constantemente en lo que leyó y no porque haya consultado ninguna fuente. Eso solo te da una máquina que sigue escribiendo desde donde tú lo dejaste. La segunda etapa, el aprendizaje por refuerzo con retroalimentación humana, hace que personas ordenen respuestas rivales hasta que aprende a contestar en vez de divagar. ¿Por qué no montar una base de datos de respuestas? Porque una base de datos solo devuelve lo que alguien metió en ella, y la predicción cubre las preguntas que nadie pensó en escribir. El coste es que sonar bien y acertar son habilidades distintas, así que puede describir sucesos que nunca ocurrieron. También parece acordarse de ti, por dos mecanismos distintos. Dentro de un chat, toda la conversación se le reenvía cada vez que pulsas enter y llena la ventana de contexto. Entre chats, productos como ChatGPT guardan notas sobre ti en almacenamiento normal y las pegan después. En ambos casos recibe un recordatorio en lugar de recordar algo.
●●○

Detail

Un LLM ha leído una cantidad absurda de texto y ha aprendido qué suele seguir a qué. La versión cruda de uno, eso sí, no sirve de mucho. Le haces una pregunta y puede responder con tres preguntas más, porque eso es algo perfectamente normal de encontrar después de una pregunta en la vida real. Alguien tuvo que sentarse a marcar miles de pares de respuestas señalando cuál era mejor, y de ahí salió el asistente educado. Así que ni es un buscador ni está consultando nada, que es por lo que puede darte una cita que jamás existió y encima con entusiasmo. El tema de la memoria también despista. Dentro de un chat parece recordar porque la conversación entera se le reenvía en cada mensaje. Entre chats, la aplicación te va tomando notas en un archivo y se las cuela por arriba en el siguiente. En ningún caso el modelo ha aprendido nada: le están pasando un recordatorio muy detallado y lo lee como leería cualquier otra cosa. 😎

¿Quieres más? Un clic profundiza.

●●●

Analogy

El texto predictivo de tu móvil hace una versión diminuta de esto. Escribe «nos vemos» y te ofrece «mañana», porque es lo que solía seguir en los mensajes que ha visto. Un gran modelo de lenguaje es esa misma idea con muchísima más lectura detrás y una visión mucho más larga de lo anterior. Ese salto de escala es lo que convierte una predicción de la siguiente palabra en algo capaz de mantener una conversación.
●●●

Analogy

Alguien que ha leído todos los libros de cocina del mundo y no ha cocinado jamás. Pregúntale qué acompaña al cordero y la respuesta es excelente, porque esa frase se ha escrito diez mil veces. Pregúntale si tu cordero concreto ya está hecho y la respuesta es igual de segura, dada desde una silla, en otro edificio. 😎

¿Concepto nuevo? Un ejemplo cotidiano lo hace clic — nuevas analogías cuando quieras.

Las explicaciones de IA pueden contener errores · No es asesoramiento profesional

Definición formal — El mismo término, explicado de la forma habitual

Un gran modelo de lenguaje es una red neuronal entrenada sobre un corpus extenso para predecir los tokens siguientes a partir de los anteriores, con recuentos de parámetros habitualmente en los miles de millones. El preentrenamiento con ese objetivo produce un sistema de continuación de texto; el ajuste fino sobre ejemplos de instrucciones y el aprendizaje por refuerzo con retroalimentación humana se aplican después para obtener el comportamiento de asistente. Los parámetros permanecen fijos durante la inferencia, y cualquier recuerdo aparente dentro de una sesión procede de que la conversación se vuelve a suministrar en la ventana de contexto.

¿Quieres que Clicked te explique términos como «large language model» directamente en tu navegador, incluso en PDFs?

Añadir a Chrome — Gratis

50 Explicaciones gratis · Sin tarjeta de crédito