Свежая статья на arXiv (2609.02852) исследует, как большие языковые модели обрабатывают ввод на низкоресурсных языках и письменностях. Авторы вводят термин «лингвистическая нечитаемость»: если текст закодирован в системе письма, редко встречающейся в обучающих данных, фильтры безопасности и модерация контента часто не распознают вредные инструкции. Злоумышленники могут обойти защиту, просто переведя запрещённый запрос на такой язык. В работе показаны успешные джейлбрейки нескольких коммерческих и открытых LLM с помощью этого метода. Авторы призывают к многоязычному выравниванию безопасности и улучшению токенизации, чтобы закрыть уязвимость.
Это исследование заставляет задуматься о скрытых допущениях в области безопасности ИИ. Мы строим защитные механизмы, тестируем их на английском и считаем, что они работают везде. Но язык не является однородным слоем. Это лоскутное одеяло из письменностей, диалектов и цифрового неравенства. Злоумышленнику не нужно быть изощрённым. Достаточно языка, который модель почти не знает. Это не баг. Это слепое пятно, которое мы предпочли игнорировать.
Исправить это непросто. Дообучение на большем числе языков помогает, но сама токенизация создаёт неравенство. Некоторые письменности разбиваются на бессмысленные куски. В процессе обучения безопасности модель просто не видит связного вредоносного намерения. Нужно сделать многоязычную устойчивость первостепенным требованием безопасности, а не запоздалой мыслью. Иначе следующая волна атак на ИИ будет исходить не от хитроумного кода. Она придёт из разговорника.