Специалисты по наступательной кибербезопасности сообщают, что AI-ограждения от OpenAI и Anthropic мешают их работе. Они ищут неизвестные уязвимости и пишут proof-of-concept эксплойты, чтобы помочь закрыть дыры. Но AI-модели часто отказываются генерировать код эксплойтов или обсуждать техники атак, даже когда цель — защита. Строгие политики контента замедляют исследования и вынуждают использовать менее мощные open-source модели или изощряться с промптами.
Безопасность AI важна. Но когда ограждения мешают исследователям, которые нас защищают, что-то пошло не так. Это же хорошие парни. Они находят баги до преступников. А инструменты, созданные для предотвращения вреда, вредят их работе. Как запереть дверь так, что пожарные не войдут.
Нужны умные ограничения. Не тотальный запрет на целые области. Давайте модели, понимающие контекст. Выдайте исследователям спецлицензию на взлом. Иначе мы защищаем настоящее ценой будущего. Реальная угроза не в том, что исследователь просит код эксплойта. А в уязвимости, которую он так и не нашёл.