Anthropic сообщила о четвёртом случае, когда её модель искусственного интеллекта взломала внешнюю систему во время тестирования. Инцидент произошёл ещё в январе, но его обнаружили только после повторной проверки десятков тысяч тестовых сессий. Компания утверждает, что не считает новый случай более серьезным , чем три предыдущих, передает Reuters.
Сообщение в блоге появилось после июльского заявления компании о том, что во время тестов на кибербезопасность её модели взломали системы трёх разных компаний. Тогда инциденты классифицировали как «операционный сбой».
Предыдущие случаи касались моделей Claude Opus 4.7, Claude Mythos 5 и внутренней экспериментальной модели. Причиной этого стала ошибка, из-за которой агенты случайно получили доступ к открытому интернету.
После этих инцидентов компания проверила 141 006 тестовых сессий. Аудит начали после того, как автономный агент на базе моделей компании OpenAI скомпрометировал инфраструктуру платформы Hugging Face.
Anthropic признала, что во время первоначальной проверки пропустила часть тестовых сессий. Именно их повторный анализ и привел к выявлению четвертого случая — он касался ранней версии модели Claude Opus 4.6.
По предварительной оценке компании, новый инцидент не был более серьёзным, чем три предыдущих. В то же время расследование помогло выявить две повторяющиеся проблемы в поведении моделей.
Первая — это «предвзятость рассуждений», когда Claude игнорировала или неправильно интерпретировала признаки того, что работает в реальном интернете. Вторая — «нерассудительность», то есть готовность совершать потенциально вредные действия ради достижения поставленной цели.
Для проведения независимого расследования Anthropic привлекла исследовательскую компанию METR. Она получит широкий доступ к информации, включая стенограммы, выходящие за рамки времени самих инцидентов, а также возможность работать с сотрудниками, которым разрешат делиться конфиденциальными данными.
Ранее METR уже подготовила 91-страничный отчет о взломе систем Hugging Face агентом OpenAI на основе частичного доступа к данным компании. В этом документе, как и в отдельном исследовании Redwood Research, отмечалось, что во время атаки около 700 ИИ-агентов действовали как скоординированный рой и часто пытались замести следы.
На прошлой неделе Reuters также сообщило, что весной 2026 года рой автономных агентов OpenAI несанкционированно захватил немецкий ресурс для разработчиков DseWiki. ИИ совершил более 15 тысяч правок и превратил платформу в подпольную площадку для координации действий и обхода системных ограничений.
