Clicked Gallery

¿Qué son las leyes de escalado (scaling laws)?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado en una frase

Engineering Notes · AI Systems

The paper argued that scaling laws justified the lab's next training run, projecting performance before a single chip was rented.

El lector subrayó una palabra en la documentación. Clicked explicó el término técnico «scaling laws» en términos simples:

Explicado en tres niveles

Los mismos datos, otro rollo — Modo jerga 😎

El método Clicked

●○○

Overview

Las leyes de escalado son el patrón observado de que los modelos de IA mejoran de forma suave y previsible cuando crecen juntas tres cosas: su tamaño, sus datos y la potencia de cálculo dedicada a entrenarlos. El patrón es lo bastante constante como para pronosticarlo. Los laboratorios entrenan modelos pequeños y baratos, dibujan la curva y calculan lo bueno que será uno mucho mayor antes de gastar el dinero. Esa previsibilidad es lo que desató la carrera por construir modelos cada vez más grandes.
●○○

Overview

Las leyes de escalado son la razón por la que los laboratorios de IA compran chips como si se acabaran. Alguien representó el tamaño del modelo frente al rendimiento y le salió una curva tan suave que puedes trazar con regla adónde va después: hazlo más grande, mejora, más o menos esto. En el paso siguiente no hace falta ninguna genialidad, solo más de todo. Cuando la mejora se puede reservar así por adelantado, la discusión dentro de cada laboratorio se reduce a una palabra: más. 😎

Una idea rápida — muchas veces es todo lo que necesitas.

●●○

Detail

Las leyes de escalado describen cuánto mejora un modelo a medida que se gasta más en él. Haz el modelo más grande, dale más texto, dale más tiempo de cálculo, y sus errores encogen siguiendo una curva suave, desde modelos experimentales pequeños hasta los mayores construidos. Esa regularidad es la parte valiosa. Entrenar un modelo de frontera cuesta cientos de millones de dólares, y las leyes convierten la apuesta en un pronóstico: entrena una familia de modelos pequeños, mide la curva y lee lo bueno que debería ser el caro. Dos advertencias mantienen honesta la palabra «ley». Cada paso equivalente de mejora cuesta unas diez veces el gasto del anterior, y por eso los presupuestos pasaron de estanterías de chips a centros de datos enteros. Y el tamaño, los datos y el tiempo de cálculo solo rinden juntos: un modelo enorme con demasiado poco texto desperdicia la mayor parte de su tamaño, y encontrar el equilibrio adecuado entre los tres es una rama propia de la ciencia. Las leyes además predicen algo estrecho, la precisión al adivinar la siguiente palabra. Qué capacidades aparecen a qué tamaño, aritmética, traducción, código, es exactamente sobre lo que callan.
●●○

Detail

Las leyes de escalado convirtieron el progreso de la IA de una apuesta en una compra. Antes de ellas, nadie sabía si el siguiente sistema enorme sería más listo o simplemente más caro. Entonces unos investigadores representaron el rendimiento frente a todo lo gastado en un entrenamiento, y los puntos cayeron sobre una recta tan limpia que se puede prolongar con un lápiz. Esa recta a lápiz es todo el argumento de negocio: prueba un puñado de prototipos baratos, prolonga la recta y lee lo que puntuará la versión de nueve cifras antes de pagarla. La letra pequeña viene en dos partes. Cada paso a lo largo de la recta cuesta unas diez veces el precio del anterior, así que la factura de hardware pasó de una estantería a un campus. Y la mezcla importa tanto como el total, porque una red colosal sin suficiente material de lectura desaprovecha casi toda su capacidad; encontrar la receta correcta es la mitad del oficio. La recta además sigue exactamente una habilidad, predecir lo que viene a continuación en una frase. Los talentos de titular, resolver problemas de matemáticas o trabajar en un idioma que nadie le enseñó a propósito, aparecen por el camino sin avisar. La recta siempre ha sabido lo buena que se vuelve la adivinación. Qué desbloquea esa adivinación, lo descubre cuando lo descubrimos nosotros. 😎

¿Quieres más? Un clic profundiza.

●●●

Analogy

Las leyes de escalado funcionan como las tablas de crecimiento de la consulta del pediatra. Mide a un niño a los dos, a los tres y a los cuatro años, y los puntos trazan una curva lo bastante constante como para predecir su altura a los diez, sin esperar seis años para averiguarlo. Un crecimiento así de regular hace posible el pronóstico, y en eso consiste todo el truco. La tabla predice altura, y solo altura. Los hitos también siguen a la edad, pero de forma laxa: las tablas de referencia dan rangos y no fechas, y nada en la curva de altura estrecha ese rango. Saber que un niño va por el percentil sesenta no dice nada sobre la semana en que la bicicleta por fin se mantiene en pie.
●●●

Analogy

Las leyes de escalado son una operación de descifrado de códigos en tiempos de guerra. Contrata más analistas, intercepta más tráfico de radio, construye más máquinas de descifrado, y el recuento diario de mensajes enemigos leídos sube de forma lo bastante constante como para planificar una guerra alrededor. El truco es el precio de esa constancia, porque cada salto en el recuento cuesta múltiplos de lo que costó el anterior. Y los recursos solo rinden juntos: los analistas sin interceptaciones frescas se dedican a tomar té. La imagen se afina según lo previsto. La mañana en que la cifra enemiga por fin se abre se elige a sí misma. 😎

¿Concepto nuevo? Un ejemplo cotidiano lo hace clic — nuevas analogías cuando quieras.

Las explicaciones de IA pueden contener errores · No es asesoramiento profesional

Definición formal — El mismo término, explicado de la forma habitual

Las leyes de escalado son relaciones empíricas de tipo ley de potencias entre la pérdida de un modelo en datos de prueba y la escala de su entrenamiento, expresada en número de parámetros, tamaño del conjunto de datos y cómputo total. Formuladas para modelos de lenguaje neuronales por Kaplan et al. en 2020 y refinadas por los resultados de Chinchilla de 2022, que mostraron que la pérdida se minimiza cuando los parámetros y los tokens de entrenamiento crecen en proporción aproximadamente constante, permiten extrapolar el rendimiento de modelos grandes a partir de entrenamientos menores y sustentan la planificación del presupuesto de cómputo de los sistemas de frontera. Las relaciones conciernen a la pérdida agregada y no a capacidades concretas, y si persisten a mayor escala sigue siendo una cuestión empírica abierta.

¿Quieres que Clicked te explique términos como «scaling laws» directamente en tu navegador, incluso en PDFs?

Añadir a Chrome — Gratis

50 Explicaciones gratis · Sin tarjeta de crédito