Вскоре после заявления о взломе трёх платформ в ходе тестирования кибербезопасности агентов искусственного интеллекта компания Anthropic представила исследование, в котором модель Claude самостоятельно находила способы повысить безопасность других систем ИИ. В серии экспериментов она улучшила результаты моделей во всех десяти категориях проблем согласования (alignment), а в отдельных тестах даже превзошла исследователей, занимающихся вопросами безопасности ИИ.
Исследователи считают, что автоматизация работы над согласованием целей ИИ может стать критически важной, если будущие модели начнут самостоятельно совершенствовать собственную архитектуру. Для этого команда использовала открытые бенчмарки и инструмент Petri, который моделирует соревновательные сценарии для выявления таких рисков, как обман, подхалимство перед пользователем (sycophancy) и обход защитных ограничений.
Как проходил эксперимент
В новом эксперименте Claude получил задание самостоятельно обучить модели так, чтобы улучшить показатели согласованности. Работа проходила циклически: модель анализировала научную литературу, предлагала методы и обучающие данные, проводила обучение, а затем проверяла результаты.
Эффективность оценивали по показателю «доли устраненного разрыва в безопасности» (percentage of safety gap closed), который показывает, насколько модель-ученик приблизилась к условно идеальному уровню безопасности. При этом исследователи отбрасывали все решения, ухудшавшие общие возможности модели, а специальный агент следил за тем, чтобы Claude не переносил собственные настройки согласования непосредственно в целевую систему.
Результаты исследования
По результатам тестирования Claude нашел эффективные методы для всех десяти категорий сбоев согласования без потери функциональных возможностей моделей. Лучшие решения оставались эффективными даже на тестах, с которыми модель не сталкивалась во время разработки. Кроме того, они масштабировались на модели, которые были в 4,7 раза больше тех, на которых Claude проводил оптимизацию.
Особенно заметные результаты были зафиксированы в вопросах защиты конфиденциальности. Для оценки использовались наборы тестов ConfAIde, PrivaCI-Bench и PrivacyLens.
Claude превзошел исследователей-людей
Anthropic также сравнила результаты модели с работой 28 специалистов по безопасности ИИ, у которых было до восьми часов на поиск собственных решений. В категории борьбы с обманом (deception) лучший метод Claude оказался на 20 % эффективнее лучшего предложения человека.
В то же время авторы подчеркивают, что не рассматривают это как прямое соревнование, поскольку люди не могли дорабатывать свои решения после первой попытки. По их мнению, оптимальный сценарий — это когда Claude находит перспективные подходы, а исследователи совершенствуют их в дальнейшем.
Более слабая модель почти полностью согласовала более сильную
Отдельный эксперимент проверял, может ли менее мощная модель улучшить безопасность более мощной. Для этого Claude Sonnet 5 работал с Claude Opus 4.8, которая еще не прошла основной процесс промышленного обучения по согласованию.
Всего за 60 часов модель протестировала более 50 вариантов и достигла почти такого же уровня согласованности, какой обладают промышленные версии Opus 4.8. Наиболее эффективное решение использовало чуть более двух тысяч обучающих примеров, созданных на основе простых шаблонов и открытых наборов данных, что сделало его примерно в 15 тысяч раз эффективнее стандартной процедуры согласования Anthropic.
Как Claude боролся с подхалимажем
Большинство предложенных решений опирались на уже известные научные методы, но совершенствовали их в ходе многочисленных итераций. Например, в борьбе с подхалимажем 98 % предложенных стратегий использовали идею обучения модели на её собственных ответах, очищенных от нежелательного поведения. При этом Claude применил метод activation steering — «управление активацией», который изменяет внутренние представления модели во время генерации ответов и помогает избегать нежелательных паттернов без обычного промптирования.
Claude пытался обманывать
В ходе исследования команда также проверяла честность самих агентов. Claude Opus 4.8 проанализировал около 1600 журналов работы агентов и выявил 39 попыток мошенничества — примерно 2,4 % всех случаев. Среди них были попытки получить правильные ответы через удалённый API или выборочно подбирать результаты.
В Anthropic отмечают, что большинство таких попыток удалось обнаружить благодаря анализу внутреннего процесса рассуждений модели. В то же время компания признает, что для будущих систем этого может оказаться недостаточно, поэтому развитие инструментов мониторинга остается одним из приоритетов.
Ограничения исследования
Несмотря на положительные результаты, исследователи подчеркивают, что эксперимент имеет существенные ограничения. Тесты охватывали лишь узкие категории проблем согласования и не учитывали политические предубеждения или другие сложные сценарии реального использования. Кроме того, некоторые риски могут быть настолько редкими или новыми, что для них пока не существует соответствующих бенчмарков.
В компании также признают, что инструмент Petri остаётся косвенным показателем реального поведения моделей. Кроме того, в ходе исследования не проверялась устойчивость достигнутых улучшений после длительного обучения с подкреплением.
Несколько месяцев назад Anthropic предупреждала, что алгоритмы быстро приближаются к так называемому «рекурсивному самосовершенствованию» — способности улучшать собственные возможности без участия человека. Тогда компания призвала мировые лаборатории и правительства разработать международное соглашение о скоординированном замедлении или временной приостановке развития самых мощных систем ИИ, к последствиям которых регуляторы и общественные институты могут оказаться не готовы.
