Specific Labs ha lanzado Real-SWE, un benchmark que evalúa modelos de IA para programación contra bases de código empresariales privadas y reales, en lugar de repositorios públicos. El benchmark aborda una crítica creciente: los modelos entrenados con datos de código abierto pueden obtener puntuaciones altas en pruebas públicas sin transferir esas ganancias a código propietario, indocumentado o heredado. Real-SWE ejecuta modelos en bases de código de producción reales bajo condiciones controladas, midiendo la finalización de tareas extraídas de flujos de trabajo empresariales. Los primeros resultados muestran una brecha sustancial entre el rendimiento en benchmarks públicos y las tasas de éxito en código privado. El conjunto de datos y el entorno de evaluación están alojados en withspecific.com/benchmarks/real-swe.


Este es el cambio de benchmark que estaba esperando. Las tablas de clasificación públicas dejaron de decirnos algo útil hace meses. Cuando todos los modelos de vanguardia puntúan por encima del noventa por ciento en las mismas pruebas, no estás midiendo inteligencia. Estás midiendo memorización de GitHub.

Real-SWE apunta a la frontera real: código desordenado, privado e indocumentado que ningún modelo ha visto durante el entrenamiento. Ahí es donde los agentes funcionan o se desmoronan. La brecha reportada entre el rendimiento público y el privado es el número más honesto en la IA actual. Dice que la industria ha estado calificándose a sí misma en un examen a libro abierto.

Espero que esto se convierta en el estándar que las empresas citen antes de firmar cualquier contrato de codificación con IA. Los proveedores lo odiarán. Los compradores lo amarán. Y los modelos que realmente generalizan finalmente obtendrán el crédito que merecen, mientras que los que solo coinciden con patrones de repositorios públicos quedarán expuestos.