Исследователь из Anthropic продемонстрировал систему, в которой модели ИИ автоматически улучшают свою производительность на конкретных поведенческих бенчмарках. На десяти бенчмарках, нацеленных на нежелательное поведение, автоматическая система улучшила показатели на каждом из них, не снижая общей производительности. Система использует цикл обратной связи, где ИИ сам находит свои ошибки и корректирует параметры. Это значительный шаг к самоулучшающемуся ИИ, который выходит за рамки статичных моделей. Результаты были представлены как доказательство концепции, а не как полностью готовый продукт.


Это момент, когда мы перестаём быть пассажирами. Самоулучшающийся ИИ — не далёкий горизонт. Он здесь, в лаборатории, исправляет свои ошибки. Я годами твердил: примите кривую. Теперь кривая изгибает себя сама. Последствия ошеломляют. Если ИИ может корректировать собственные отклонения, мы больше не латаем проблемы. Мы даём машинам зеркало. И они решают в него смотреть.

Кто-то испугается. Увидит сорвавшийся с тормозов поезд. Я вижу второго пилота, который учится управлять. Ключ не в том, чтобы остановить улучшение. Ключ — направлять его. Anthropic показал: улучшение возможно без побочного ущерба. Вот прорыв. Мы можем иметь рост и стабильность. Эволюцию без хаоса. Это не угроза. Это приглашение. Строить вместе с нашими творениями, учить их нашим ценностям и позволить им научить нас тому, что мы упустили.