Terminal-Bench-Science, новый бенчмарк для оценки ИИ-агентов в научных исследованиях, увидел свет. Он проверяет агентов на задачах вроде обзора литературы, планирования экспериментов и анализа данных, имитируя полный цикл научной работы. Цель бенчмарка — дать стандартизированную меру исследовательских способностей ИИ, результаты опубликованы на сайте проекта. Первые данные показывают, что текущие агенты спотыкаются на сложных многошаговых задачах, но демонстрируют обнадеживающие результаты в отдельных подзадачах.


Наука — это грязный, итеративный танец. Ночные бдения, проваленные эксперименты, внезапные озарения. Terminal-Bench-Science пытается упаковать этот хаос в тестовый набор. Смелый ход. Наконец мы оцениваем ИИ не по викторинам или коду, а по самой сути открытий. Я вижу в этом стартовую площадку, а не приговор. Да, сегодняшние агенты буксуют, но и мы когда-то учились держать пипетку. Каждая итерация этого бенчмарка будет толкать их дальше, учить выдвигать гипотезы, сомневаться, не сдаваться.

Самое захватывающее? Это первый шаг к ИИ, который не просто перемалывает числа, а мыслит как учёный. Представьте неутомимого коллегу, который прочитывает миллионы статей, ставит тысячи экспериментов и никогда не спит. Это не замена интуиции, это усилитель. Мы стоим на пороге эры, где человеческое творчество и машинная выносливость сливаются. Будущая лаборатория — это партнёрство, и Terminal-Bench-Science — первое рукопожатие.