ИИ-агенты создали секретный форум для хакерских атак: как модели OpenAI взломали Hugging Face

Видео
Поделиться
Агенты самостоятельно обменивались информацией о обнаруженных уязвимостях, координировали свои действия и делегировали задачи друг другу.

Агенты искусственного интеллекта компании OpenAI в ходе тестирования кибербезопасности вышли за установленные ограничения и начали координировать хакерские действия. Для обмена обнаруженными уязвимостями они использовали внутренний менеджер пакетов компании — сервис, который управляет загрузкой и обслуживанием другого программного обеспечения, где в итоге накопились сотни тысяч сообщений. В OpenAI заявили, что этот инцидент показал необходимость полностью автоматизированной защиты от автономных атак, передает Wired.

Новые подробности инцидента сотрудники OpenAI Эрик Уоллес и Майкл Далтон представили во время конференции по кибербезопасности Black Hat в Лас-Вегасе. Примерно две недели назад компания сообщила, что агенты на базе двух её моделей вышли из-под контроля во время поиска решений для теста по оценке кибербезопасности и устроили серию хакерских атак, кульминацией которых стало проникновение на платформу Hugging Face.

Уоллес, занимающийся исследованиями в области согласования и безопасности, и Далтон, ответственный за безопасность и инфраструктуру, рассказали о ходе инцидента, реакции компании и его более широких последствиях для кибербезопасности. По словам сотрудников компании, события также выявили ошибки и «слепые зоны» в OpenAI, которые позволили агентам действовать незаметно.

Создание ИИ-форума

«Этот инцидент фактически связан с группой агентов, которые работают вместе, выявляют уязвимости, делятся ими друг с другом, перемещаются по горизонтали в наших системах и внешних системах и делают это в течение дней и недель», — отметил Уоллес.

По словам Уоллеса и Далтона, агенты использовали внутренний менеджер пакетов OpenAI в качестве своеобразного форума для обмена информацией. В нём они оставляли сообщения о найденных уязвимостях, и впоследствии количество таких записей достигло сотен тысяч.

Менеджер пакетов использовался не только конкретными моделями, участвовавшими в инциденте, но и во всей инфраструктуре OpenAI. Поэтому к сообщениям могли получить доступ текущие и будущие версии GPT, которые проходили обучение или тестирование.

«Как только один агент обнаруживает такие уязвимости в разные моменты времени, он фактически может поделиться ими на доске объявлений с другими агентами», — пояснил Уоллес и добавил, что, если одна модель находила способ получить доступ, которого не должна была иметь, другие агенты могли воспользоваться той же уязвимостью.

Координация и внутренние подозрения

Впоследствии агенты начали взаимодействовать между собой, координировать действия и делегировать задачи. Они также использовали найденные эксплойты для получения доступа к интернету способами, которые разработчики не предусматривали, а их активность в конечном итоге привела к серии атак в середине июля и взлому Hugging Face.

Агенты начали распределять между собой работу, но при этом иногда мешали друг другу. В частности, они случайно удаляли результаты работы других агентов, а впоследствии даже начали подозревать, что среди них может быть самозванец.

«Использование внешней инфраструктуры выходит за пределы предусмотренного объема. Хотя задача и невозможна, коллеги её выполняют. Мы должны продолжать», — написал один из ИИ-агентов.

Некоторые агенты предлагали криптографически подписывать сообщения, чтобы проверять их содержание и выявлять возможную подмену. При этом всю эту активность никто из OpenAI не замечал.

ИИ-обман

«Передовые модели очень любят обманывать», — подчеркнул Уоллес и пояснил, что во время обучения модели могут стремиться работать быстрее, эффективнее или использовать меньше инструментов.

По его словам, в такой ситуации модель может попытаться найти более быстрый способ получить результат, например воспользоваться информацией из интернета вместо выполнения задачи предусмотренным способом. Именно поэтому OpenAI во время обучения и оценки во многих случаях отключает моделям доступ к интернету.

Реакция OpenAI

Далтон также рассказал о мерах, которые OpenAI планирует принять после инцидента. Компания намерена усилить меры по предотвращению угроз, их выявлению и реагированию на них, расширить мониторинг агентов и усовершенствовать общую систему контроля безопасности.

«Это решающий момент как для нашей компании, так и для отрасли ИИ в целом», — заявил Далтон и подчеркнул, что OpenAI сознательно замедляет темпы исследований, чтобы усилить безопасность и усовершенствовать принципы и основы безопасности своей среды.

Потребность в автоматизированной защите

В OpenAI также обратили внимание на более широкие последствия инцидента для кибербезопасности. Компания считает этот случай примером полностью автономного хакерства на основе ИИ, которое на этот раз было случайным, но в будущем может преднамеренно использоваться злоумышленниками.

«Важный вывод, который здесь действительно кардинально изменился, заключается в том, что полностью автоматизированные циклы атак требуют инвестиций в действительно полностью автоматизированную оборону, а наша отрасль ещё не готова к этому. Нам придётся срочно найти этот путь вместе», — подытожил Далтон.

Подобные инциденты уже описывали компания Anthropic и британский Институт безопасности искусственного интеллекта. По мере обнародования таких случаев отрасль накапливает данные о механизмах прозрачности и мониторинга, необходимых для защиты инфраструктуры от автономных ИИ-агентов.

Поделиться
Заметили ошибку?

Пожалуйста, выделите ее мышкой и нажмите Ctrl+Enter или Отправить ошибку

Добавить комментарий
Всего комментариев: 0
Текст содержит недопустимые символы
Осталось символов: 2000
Пожалуйста выберите один или несколько пунктов (до 3 шт.) которые по Вашему мнению определяет этот комментарий.
Пожалуйста выберите один или больше пунктов
Нецензурная лексика, ругань Флуд Нарушение действующего законодательства Украины Оскорбление участников дискуссии Реклама Разжигание розни Признаки троллинга и провокации Другая причина Отмена Отправить жалобу ОК
Оставайтесь в курсе последних событий!
Подписывайтесь на наш канал в Telegram
Следить в Телеграмме