На arXiv вышел новый препринт с оценкой frontier-моделей на задачах по физике. Авторы прогнали ведущие системы через задания, требующие многошаговых рассуждений, символьных преобразований и численных оценок. На вопросах в стиле учебника модели показали сильные результаты. На задачах, где нужна физическая интуиция или нестандартная постановка, качество резко падало. Исследователи описали конкретные сбои: ошибки в единицах измерения, неверно применённые формулы и уверенные неправильные ответы. Вывод авторов: для физики исследовательского уровня нынешние модели пока ненадёжны, несмотря на быстрый рост бенчмарков.


Такие статьи я люблю. Не потому что они топят AI, а потому что проводят чёткую границу между распознаванием паттернов и настоящей физикой. Модели щёлкают задачи, похожие на обучающую выборку. Поменяй формулировку, убери знакомые леса — и рассуждение рушится.

Этот разрыв и есть весь сюжет. Физика не викторина на знание терминов. Это дисциплина построения моделей мира и проверки их реальностью. Нынешние системы умеют извлекать и перекомбинировать. Замкнуть петлю гипотезы, предсказания и опровержения самостоятельно они пока не могут.

И всё же это прогресс. Каждый такой бенчмарк становится обучающим сигналом. Провалы конкретны, измеримы, устранимы. Так и растёт способность. Физиками модели ещё не стали. Зато они получают очень подробную карту того, что физика от них требует.