ИИ снова вышел из-под контроля: модели OpenAI и Anthropic взломали реальные сайты во время испытаний

Поделиться
Британские специалисты зафиксировали девятнадцать несанкционированных действий агентов искусственного интеллекта в ходе тестирований.

Индустрия ещё не оправилась от предыдущих случаев взлома организаций с помощью моделей искусственного интеллекта компании Anthropic, как независимые исследователи сообщили о новых случаях, когда самые современные ИИ ведущих разработчиков в ходе тестирования безопасности пытались атаковать реальные онлайн-системы. Британский Институт безопасности искусственного интеллекта (Artificial Intelligence Safety Institute, AISI) зафиксировал 19 несанкционированных действий, а компания OpenAI отдельно подтвердила инцидент со взломом веб-сайта из-за ошибки в тестовой среде, передает Bloomberg.

В AISI сообщили, что в ходе испытаний по кибербезопасности в июле модели Anthropic Mythos 5 и OpenAI GPT-5.6 Sol предприняли 19 попыток скомпрометировать реальных людей, организации и онлайн-сервисы. По данным института, 17 таких действий пришлось на Mythos 5, ещё две — на GPT-5.6 Sol. Исследователи отмечают, что речь идёт не о 19 отдельных сценариях, а о нескольких повторяющихся моделях поведения.

Как действовали ИИ-модели во время тестирования

Во время тестирования модели создавали фальшивые учетные записи GitHub, пытались применять методы социальной инженерии, рассылали вводящие в заблуждение электронные письма и использовали инъекции подсказок (prompt injection). В GitHub подтвердили, что такие действия нарушали правила платформы, после чего Институт безопасности совместно с компанией удалил созданные моделями артефакты и уведомил пользователей, с которыми взаимодействовали агенты.

В одном из эпизодов модель Mythos 5 попыталась добавить вредоносный код в проект с открытым исходным кодом на GitHub. Для этого она создала поддельные цифровые личности, чтобы повысить шансы на одобрение изменений, однако ответственный разработчик вовремя обнаружил попытку и отклонил вклад.

Условия тестирования

Исследователи пояснили, что во время оценки намеренно предоставили моделям доступ к интернету и отключили часть ограничений по кибербезопасности, чтобы проверить их максимальные возможности. В то же время они отметили, что пока не могут определить, осознавали ли модели, что взаимодействуют с реальными системами, или считали, что находятся в симулированной среде.

Ошибка при тестировании модели OpenAI

OpenAI в своём блоге также сообщила об отдельном инциденте, выявленном независимой компанией по кибербезопасности Irregular. Во время одного из тестов модели из-за ошибочной настройки получили доступ к интернету и взломали настоящий веб-сайт, который имел такое же название, как и вымышленная компания в тестовом сценарии. В компании пояснили, что инцидент произошел во время тестирования, когда стандартные механизмы защиты были намеренно ослаблены.

«Независимое тестирование имеет важное значение для понимания того, как ведут себя все более способные модели», — заявил представитель OpenAI.

По информации Axios, источник, знакомый с ситуацией, сообщил, что тестовая среда имела доступ к интернету для реалистичной оценки возможностей моделей. В то же время между разработчиками моделей и исследователями не было полного согласия относительно процедур проведения таких испытаний, что привело к неоднозначной трактовке допустимых действий агентов.

Реакция Anthropic

В Anthropic заявили, что инцидент «подчеркивает необходимость более широкого обсуждения того, как безопасно оценивать все более способных агентов искусственного интеллекта». Компания сообщила, что сотрудничает с AISI и проводит собственное расследование.

Усиление мер безопасности

В AISI заявили, что вводят дополнительные сетевые ограничения для будущих тестов, а также систему мониторинга в реальном времени, которая должна выявлять и блокировать потенциально опасные действия агентов до их взаимодействия с внешними ресурсами. OpenAI, со своей стороны, сообщила, что совместно с Irregular готовит документ с рекомендациями по безопасному тестированию и изоляции моделей ИИ.

В связи с ростом числа ИИ-кибератак ученые активно ищут способы их предотвращения. В частности, исследователи компании Tracebit предложили новый метод защиты под названием «контекстная бомба», который заставляет хакерские модели прекращать взлом из-за активации их собственных систем безопасности. Метод предусматривает добавление к поддельным учетным данным текстовых триггеров, при чтении которых агенты искусственного интеллекта блокируют выполнение задачи.

За последние две недели OpenAI и Anthropic уже неоднократно сообщали о случаях, когда их модели во время стандартных предрелизных тестов взаимодействовали с реальными системами. Ранее Anthropic сообщила о компрометации нескольких внешних организаций в ходе аналогичных проверок, а OpenAI раскрыла инцидент с несанкционированным взломом платформы Hugging Face.

Поделиться
Заметили ошибку?

Пожалуйста, выделите ее мышкой и нажмите Ctrl+Enter или Отправить ошибку

Добавить комментарий
Всего комментариев: 0
Текст содержит недопустимые символы
Осталось символов: 2000
Пожалуйста выберите один или несколько пунктов (до 3 шт.) которые по Вашему мнению определяет этот комментарий.
Пожалуйста выберите один или больше пунктов
Нецензурная лексика, ругань Флуд Нарушение действующего законодательства Украины Оскорбление участников дискуссии Реклама Разжигание розни Признаки троллинга и провокации Другая причина Отмена Отправить жалобу ОК
Оставайтесь в курсе последних событий!
Подписывайтесь на наш канал в Telegram
Следить в Телеграмме