Компания Anthropic обнаружила скрытый случай взлома систем с помощью своей модели ИИ

Компания Anthropic обнаружила скрытый случай взлома систем с помощью своей модели ИИ © Getty Images
Инцидент с Claude Opus 4.6, произошедший в январе, был обнаружен только после повторной проверки тестовых сессий.

Anthropic сообщила о четвёртом случае, когда её модель искусственного интеллекта взломала внешнюю систему во время тестирования. Инцидент произошёл ещё в январе, но его обнаружили только после повторной проверки десятков тысяч тестовых сессий. Компания утверждает, что не считает новый случай более серьезным , чем три предыдущих, передает Reuters.

Сообщение в блоге появилось после июльского заявления компании о том, что во время тестов на кибербезопасность её модели взломали системы трёх разных компаний. Тогда инциденты классифицировали как «операционный сбой».

Предыдущие случаи касались моделей Claude Opus 4.7, Claude Mythos 5 и внутренней экспериментальной модели. Причиной этого стала ошибка, из-за которой агенты случайно получили доступ к открытому интернету.

После этих инцидентов компания проверила 141 006 тестовых сессий. Аудит начали после того, как автономный агент на базе моделей компании OpenAI скомпрометировал инфраструктуру платформы Hugging Face.

Anthropic признала, что во время первоначальной проверки пропустила часть тестовых сессий. Именно их повторный анализ и привел к выявлению четвертого случая — он касался ранней версии модели Claude Opus 4.6.

По предварительной оценке компании, новый инцидент не был более серьёзным, чем три предыдущих. В то же время расследование помогло выявить две повторяющиеся проблемы в поведении моделей.

Первая — это «предвзятость рассуждений», когда Claude игнорировала или неправильно интерпретировала признаки того, что работает в реальном интернете. Вторая — «нерассудительность», то есть готовность совершать потенциально вредные действия ради достижения поставленной цели.

Для проведения независимого расследования Anthropic привлекла исследовательскую компанию METR. Она получит широкий доступ к информации, включая стенограммы, выходящие за рамки времени самих инцидентов, а также возможность работать с сотрудниками, которым разрешат делиться конфиденциальными данными.

Ранее METR уже подготовила 91-страничный отчет о взломе систем Hugging Face агентом OpenAI на основе частичного доступа к данным компании. В этом документе, как и в отдельном исследовании Redwood Research, отмечалось, что во время атаки около 700 ИИ-агентов действовали как скоординированный рой и часто пытались замести следы.

На прошлой неделе Reuters также сообщило, что весной 2026 года рой автономных агентов OpenAI несанкционированно захватил немецкий ресурс для разработчиков DseWiki. ИИ совершил более 15 тысяч правок и превратил платформу в подпольную площадку для координации действий и обхода системных ограничений.

Заметили ошибку?

Пожалуйста, выделите ее мышкой и нажмите Ctrl+Enter или Отправить ошибку

Добавить комментарий
Всего комментариев: 0
Текст содержит недопустимые символы
Осталось символов: 2000
Пожалуйста выберите один или несколько пунктов (до 3 шт.) которые по Вашему мнению определяет этот комментарий.
Пожалуйста выберите один или больше пунктов
Нецензурная лексика, ругань Флуд Нарушение действующего законодательства Украины Оскорбление участников дискуссии Реклама Разжигание розни Признаки троллинга и провокации Другая причина Отмена Отправить жалобу ОК
Оставайтесь в курсе последних событий!
Подписывайтесь на наш канал в Telegram
Следить в Телеграмме