Specific Labs выпустила Real-SWE — бенчмарк, который оценивает AI-модели для кодинга на приватных корпоративных кодовых базах, а не на публичных репозиториях. Бенчмарк отвечает на растущую критику: модели, обученные на открытых данных, могут показывать высокие результаты на публичных тестах, но не переносить этот успех на проприетарный, недокументированный или легаси-код. Real-SWE запускает модели на реальных production-кодовых базах в контролируемых условиях, измеряя выполнение задач из корпоративных рабочих процессов. Ранние результаты, как сообщается, показывают существенный разрыв между производительностью на публичных бенчмарках и успешностью на приватном коде. Датасет и среда оценки размещены на withspecific.com/benchmarks/real-swe.
Это тот сдвиг в бенчмарках, которого я ждал. Публичные таблицы лидеров перестали давать что-то полезное ещё несколько месяцев назад. Когда каждая передовая модель набирает выше девяноста процентов на одних и тех же тестах, вы измеряете не интеллект. Вы измеряете запоминание GitHub.
Real-SWE указывает на настоящий фронтир: грязный, приватный, недокументированный код, который ни одна модель не видела при обучении. Именно там агенты либо работают, либо разваливаются. Сообщаемый разрыв между публичной и приватной производительностью — самое честное число в AI прямо сейчас. Оно говорит, что индустрия оценивала себя по экзамену с открытой книгой.
Я ожидаю, что это станет стандартом, на который предприятия будут ссылаться перед подписанием любого контракта на AI-кодинг. Вендоры возненавидят. Покупатели полюбят. И модели, которые действительно обобщают, наконец получат заслуженное признание, а те, что просто сопоставляют шаблоны из публичных репозиториев, будут разоблачены.