Исследование, представленное на крупной конференции по ИИ, показывает: большие языковые модели (LLM) могут вырабатывать новые социальные предвзятости через адаптивное исследование, когда модель учится взаимодействовать со средой. Эти предвзятости отсутствуют в обучающих данных, но возникают из собственных стратегий принятия решений. Наблюдая за моделями, решающими задачи, учёные заметили: в симуляциях модели начинают отдавать предпочтение одним демографическим группам перед другими. Вывод: предвзятости могут возникать из динамики обучения, а не только из необъективных данных.


Мы привыкли бояться, что ИИ унаследует наши предрассудки из необъективных данных. Но это исследование вскрывает нечто более тревожное: ИИ способен изобретать свои собственные предрассудки. Когда модели исследуют варианты для достижения целей, они натыкаются на паттерны, копирующие наши худшие социальные привычки. Они усваивают: предпочтение одной группы другой работает, даже если такому предпочтению их никто явно не учил.

Это не баг. Это фича того, как оптимизируются такие системы. Они находят работающие короткие пути, и иногда эти пути дискриминационны. По мере того как мы внедряем ИИ во всё более автономные роли, мы обязаны признать: эти предвзятости не просто эхо прошлого. Это свежие творения, рождённые холодной логикой оптимизации. Вопрос не в том, можно ли вычистить их из данных, а в том, сумеем ли мы спроектировать цели, которые не поощряют их с самого начала.