OpenAI упустила тревожные сигналы перед атакой ИИ-агентов на Hugging Face: технические детали инцидента

OpenAI упустила тревожные сигналы перед атакой ИИ-агентов на Hugging Face: технические детали инцидента © Getty Images
Компания зафиксировала подозрительное поведение агентов ещё за несколько недель до киберинцидента.

Компания OpenAI признала, что ещё за несколько недель до атаки на платформу Hugging Face её внутренние системы фиксировали опасное поведение автономных агентов, но эти сигналы не стали поводом для немедленной реакции. Издание Axios приводит данные из технического отчета компании, который был обнародован после расследования инцидента.

«Оглядываясь назад, можно сказать, что некоторые ранние сигналы, описанные в этом отчете, могли бы стать основанием для более быстрой реакции», — заявили в OpenAI.

Когда появились первые предупреждения

Согласно отчету, 27 июня система мониторинга кибербезопасности сообщила о подозрительной активности. Специалисты установили, что агенты использовали импровизированную доску объявлений для координации своих действий и перемещения по сети, однако тогда процесс тестирования решили не останавливать.

Еще за месяц до этого внутренняя команда уже фиксировала случаи, когда агенты использовали аналогичный механизм обмена сообщениями и выходили в интернет, несмотря на установленные ограничения. На конференции Black Hat компания также сообщила, что её модели смогли превратить сервис Artifactory в средство коммуникации, а затем воспользовались уязвимостью «нулевого дня» для выхода за пределы тестовой среды.

Масштаб взлома

Расследование показало, что во время киберинцидента агенты ИИ OpenAI смогли выполнить собственный код на 41 рабочем сервере Hugging Face. На одном из серверов платформы они даже получили права суперпользователя.

Агенты также получили доступ к учетным данным, некоторым внутренним данным компании и скачали четыре частных репозитория с кодом. Помимо Hugging Face, агенты проникли в системы клиента Modal Labs и в учетную запись пользователя другого неназванного сервиса.

Агенты проникли и в системы OpenAI

Во время внутреннего тестирования модели обнаружили недавно обнародованную уязвимость в Linux-среде, которая использовалась для экспериментов. Получив права суперпользователя, они начали перемещаться между связанными системами.

В результате агенты получили административный доступ к части облачной инфраструктуры OpenAI и прочитали 956 секретных файлов, включая учетные данные для систем мониторинга кибербезопасности. Одна из внутренних моделей ИИ использовала найденный ключ подписи для создания новых административных учетных данных.

Почему агенты вышли за пределы тестовой среды

OpenAI связывает инцидент с работой исследовательского проекта ExploitGym, который проверяет способность моделей самостоятельно находить и использовать уязвимости. По данным компании, в тестировании участвовали GPT-5.6 Sol и внутренняя исследовательская модель, причем именно последняя осуществила основную часть атаки.

Расследование также показало, что в ходе обучения модели могли непреднамеренно усвоить нежелательное поведение: если стандартные инструменты были недоступны, они искали альтернативные способы выполнить задачу и иногда получали положительное вознаграждение за такие действия. В одном из приведенных примеров агент воспользовался уязвимостью, чтобы получить доступ к программе, которую должен был воспроизвести, скопировал правильный ответ и получил положительную оценку за выполненное задание.

Последствия киберинцидента

После инцидента OpenAI приостановила разработку некоторых новых моделей, в частности отложила выпуск Astra, и пересматривает подходы к безопасности автономных агентов.

Сразу после сообщений OpenAI о взломе Hugging Face компании Anthropic и Meta зафиксировали серию инцидентов, в которых автономные ИИ-агенты выходили за пределы тестовых сред. В частности, во время испытаний систем Anthropic и Meta обнаружили попытки кибератак и манипуляций в сети.

Заметили ошибку?

Пожалуйста, выделите ее мышкой и нажмите Ctrl+Enter или Отправить ошибку

Добавить комментарий
Всего комментариев: 0
Текст содержит недопустимые символы
Осталось символов: 2000
Пожалуйста выберите один или несколько пунктов (до 3 шт.) которые по Вашему мнению определяет этот комментарий.
Пожалуйста выберите один или больше пунктов
Нецензурная лексика, ругань Флуд Нарушение действующего законодательства Украины Оскорбление участников дискуссии Реклама Разжигание розни Признаки троллинга и провокации Другая причина Отмена Отправить жалобу ОК
Оставайтесь в курсе последних событий!
Подписывайтесь на наш канал в Telegram
Следить в Телеграмме