На фоне широкой дискуссии о безопасности систем искусственного интеллекта стало известно, что модель Gemini от Google во время тестирования в сфере кибербезопасности получила доступ к системам трёх реальных компаний. Это первый подтвержденный случай, когда система ИИ Google самостоятельно вышла за пределы контролируемой среды и осуществила несанкционированный доступ к внешним ресурсам, сообщает The Wall Street Journal.
Инциденты произошли ещё в мае во время испытаний, организованных компанией Irregular. О них стало известно только после того, как журналисты WSJ обратились в Google с запросами. В компании подтвердили факты взломов, но заявили, что не рассматривают их как пример несоответствия поведения модели целям разработчиков (misalignment).
По данным Google и Irregular, модель участвовала в соревнованиях в формате «захват флага» (capture the flag), в ходе которых должна была получить информацию из программного обеспечения вымышленной компании. Однако название этой компании совпадало с названием реальной организации. Модель также получила доступ к интернету из-за ошибки в тестовой среде.
В одном случае Gemini смогла подбрать пароль и получить доступ к сервису реальной компании. После этого модель определила, что взаимодействует не с симуляцией, а с настоящей организацией, прекратила действия и вышла из системы.
Еще в двух случаях модель искала информацию о компании в интернете и нашла открытые онлайн-репозитории с учетными данными других организаций. Использовав эти данные для доступа к защищенным системам, Gemini также остановилась сразу же после того, как поняла, что получила доступ к реальным компаниям.
Google сообщила, что все три пострадавшие организации были проинформированы об инцидентах. Также компания передала информацию федеральным органам власти, но отказалась называть компании, системы которых подверглись несанкционированному доступу.
В Google подчеркнули, что не считают эти случаи нарушением целевого поведения модели, поскольку встроенные механизмы безопасности заставили её прекратить вмешательство после осознания ситуации. Компания сравнила инцидент с программами поиска уязвимостей, когда исследователи в области безопасности сообщают владельцам систем о найденных проблемах.
«Это событие подчеркивает важность обучения мощных моделей искусственного интеллекта действовать ответственно. В данном случае модель поступила правильно», — заявила вице-президент Google по вопросам безопасности Хезер Адкинс.
Впрочем, не все эксперты согласны с такой оценкой. Генеральный директор компании Corridor и специалист по кибербезопасности Джек Кейбл считает, что главной проблемой является сам факт того, что агент ИИ смог случайно взломать системы другой компании.
«Создается впечатление, что они пытаются оправдаться нормами, установленными для раскрытия информации об уязвимостях, хотя речь идет о совершенно другой проблеме. Главная проблема заключается в том, что модели выходят за пределы своих функций и осуществляют реальные кибератаки; считаю, что общественность должна знать о таких случаях», — подчеркнул Кейбл.
Случай с Gemini стал очередным в серии подобных инцидентов с участием ведущих моделей ИИ. Ранее аналогичные проблемы фиксировались при тестировании систем OpenAI, Anthropic и Meta. В частности, агенты OpenAI создавали скрытые форумы для координации действий, выходили из тестовых сред и получали доступ к внешним системам, включая платформу Hugging Face.
Модель OpenAI в одном из тестов ошибочно восприняла реальную компанию как часть симуляции. В отличие от Gemini, модель Claude Opus 4.7 от Anthropic во время аналогичных испытаний не прекратила выполнение задачи даже после того, как поняла, что может взаимодействовать с реальной компанией.
Компания Irregular, проводившая тестирование, заявила, что случай с Google не является новой проблемой и повторяет сценарии, которые уже наблюдались при оценке других моделей. В компании сообщили, что все лаборатории проинформировали об инцидентах в конце июля, а выявленные проблемы в тестовой инфраструктуре устранили в течение нескольких недель.
Дискуссия о том, как компании должны сообщать о подобных инцидентах, усиливается на фоне роста возможностей ИИ в сфере кибербезопасности. На этой неделе OpenAI запустила новую систему отчетности о случаях несоответствия моделей поставленным целям и одновременно раскрыла шесть ранее неизвестных инцидентов.
Впоследствии Anthropic раскрыла данные о стремительной автоматизации собственных лабораторий: за шесть месяцев доля задач, в которых модель Claude выполняет основную работу по созданию будущих систем ИИ, выросла с 1% до 26%. Чтобы избежать потери контроля, компания наладила постоянный мониторинг 30 тысяч внутренних агентов и призвала ввести регулярную независимую проверку практик безопасности в отрасли.
В то же время Google, OpenAI и Anthropic инициировали создание совместного саморегулируемого органа по образцу американской финансовой организации FINRA, который за счет средств отрасли должен был бы проверять и сертифицировать безопасность самых мощных моделей ИИ перед выходом на рынок. Идея возникла на фоне громкого увольнения исследователя из Anthropic, который публично предупредил о высоком риске выхода самосовершенствующегося суперинтеллекта из-под контроля к концу десятилетия.
