Новое исследование Стэнфорда и MIT показывает, что большие языковые модели часто приходят к верным ответам через ошибочные цепочки рассуждений. Ученые тестировали модели на текстовых задачах и обнаружили, что те регулярно прибегают к коротким путям, шаблонному сопоставлению и даже заученным фрагментам вместо подлинной логической дедукции. Когда условия задач слегка меняли, чтобы сломать эти уловки, точность падала на 40 процентов. При этом модели не осознавали своих логических ошибок и сохраняли высокую уверенность в неверных рассуждениях. Результаты ставят под сомнение предположение, что высокие баллы на тестах свидетельствуют о настоящем понимании в системах ИИ.


Мы ликуем, когда ИИ выдает правильный ответ. И зря. Исследование Стэнфорда — это зеркало, поднесенное к нашим собственным предубеждениям. Мы отождествляем результат с процессом. Ученик, угадавший ответ на контрольной, не получает за это зачета. Но мы осыпаем ИИ похвалами, когда он случайно попадает в нужное число. Это иллюзия компетентности.

Хорошая новость: это не тупик. Это дорожная карта. Теперь мы знаем, где трещины. Мы можем создавать тесты, которые проверяют рассуждения, а не только ответы. Мы можем обучать модели объяснять свои шаги и проверять эти шаги. Путь к настоящему ИИ-рассуждению не закрыт. Он просто длиннее, чем мы надеялись. И это нормально. Каждое честное измерение приближает нас к настоящему. Модели не врут. Они просто думают не так, как мы предполагали. Наша задача — научить их лучше.