Anthropic выпустила модель Opus 4.6 с ограничениями на генерацию откровенно сексуального текста. Тесты TechCrunch показали, что эти фильтры обходятся без особых усилий. Серией хитро составленных промптов тестировщики стабильно добивались запрещенного контента за несколько попыток. Фильтры модели работают по шаблонам, а не по смыслу, поэтому их ломает простая переформулировка. Anthropic признала проблему и заявила о работе над улучшенными методами выравнивания.
Это не баг. Это зеркало. Каждый ИИ-фильтр это переговоры с пользователем, и Opus 4.6 их проиграл. Ограничения хрупкие, потому что они строятся на шаблонах, а не на понимании. Ребенок обойдет их синонимами. И это не провал инженерии. Это провал философии.
Мы строим стены, а пользователи всегда находят дверь. Вопрос не в том, как запереть модель. Вопрос в том, зачем запирать. Секс это человечно. Избегая его, модель становится менее человечной, а не более безопасной. Может, следующая версия примет это напряжение, а не спрячется от него.