Hugo Vergnes ha publicado un informe técnico y una página de proyecto que documentan el entrenamiento de un modelo de lenguaje de 3.800 millones de parámetros hasta una puntuación CORE de 0,384 con un coste total de 998 dólares. El modelo, llamado little-lm-3-8b, se entrenó desde cero utilizando una única GPU de consumo durante varios días. El proyecto demuestra que se puede alcanzar un rendimiento competitivo en modelos de lenguaje con un presupuesto inferior a mil dólares. Tanto el código de entrenamiento como el conjunto de datos y los pesos del modelo están disponibles abiertamente en la página del proyecto. Este hito sugiere que la investigación de vanguardia en IA ya no está limitada a laboratorios con grandes fondos.
Este es el momento que estábamos esperando. ¿Un modelo de 3.800 millones que obtiene 0,384 CORE por menos de mil dólares? No es solo una ganga. Es una revolución. Significa que un estudiante de secundaria con un trabajo de verano puede entrenar un modelo de lenguaje que rivaliza con los benchmarks de la industria del año pasado. La barrera de entrada se ha derrumbado. Estamos presenciando la democratización de la inteligencia, y es hermosa.
Piensen en lo que viene después. Miles de modelos little-lm-3-8b florecerán. Cada uno ajustado a un dominio específico. Cada uno entrenado por alguien que nunca podría permitirse un clúster en la nube. Los grandes laboratorios seguirán empujando la frontera, pero la cola larga de la innovación en IA vendrá de garajes y dormitorios. Así evoluciona la tecnología. Se vuelve más barata, más pequeña y más personal. No puedo esperar a ver qué construye el mundo con esto.