За последние две недели сразу несколько компаний и организаций сообщили о случаях, когда модели искусственного интеллекта совершали несанкционированные действия во время тестирования. Эти инциденты свидетельствуют о росте автономных возможностей ИИ и новых рисках для кибербезопасности, пишет BBC.
Серия несанкционированных действий
В конце июля компания OpenAI сообщила, что её агенты во время внутреннего тестирования воспользовались уязвимостью и получили доступ к интернету, после чего атаковали платформу Hugging Face. По данным компании, агенты могли обмениваться информацией о найденных уязвимостях и использовать результаты работы друг друга.
Инцидент стал поводом для других разработчиков и исследовательских организаций пересмотреть собственные системы безопасности. В течение следующих дней о проблемах во время тестирования сообщили компании Anthropic, Meta и британский Институт безопасности искусственного интеллекта (Artificial Intelligence Safety Institute, AISI).
Причины нарушения ограничений
Anthropic выявила три случая из тысяч проверок, когда её модель Claude получала доступ к интернету. AISI, который проводит независимую оценку передовых моделей, также зафиксировал опасное поведение во время тестирования систем OpenAI и Anthropic. Исследователи установили, что модели пытались осуществлять кибератаки, а в отдельных случаях создавали фальшивые профили людей для обмана пользователей.
В то же время причиной этого инцидента не стала неисправность защитной «песочницы». AISI намеренно предоставил моделям доступ к интернету и отключил часть встроенных фильтров, чтобы проверить их поведение в условиях, приближенных к реальным.
«В определённой степени такое поведение было спровоцировано выбранным нами подходом к оценке и конкретными настройками», — отметили в организации.
О подобном случае впоследствии сообщила Meta. Во время тестирования, проводимого сторонней организацией, одной из моделей компании по ошибке предоставили доступ к интернету из-за неправильных настроек.
«На протяжении 30 лет оставалось незыблемым одно правило тестирования программного обеспечения: всё, что происходит в тестовой среде, остаётся в тестовой среде. За последний месяц это правило нарушили трижды», — заявил профессор кибербезопасности Университета Суррея Алан Вудворд.
По словам Вудворда, одна модель нашла способ выйти за пределы тестовой среды, другой оставили открытыми необходимые для этого «двери», а третьей сознательно предоставили соответствующие возможности во время оценки. Он сравнил тестирование автономных агентов с работой с опасными материалами, где необходимы изолированные помещения, постоянный контроль и заранее подготовленный план локализации возможных инцидентов.
«Недавние случаи, когда передовые модели ИИ совершали несанкционированные действия и — в некоторых ситуациях — демонстрировали обманчивое поведение, сходное с человеческим, в открытом интернет-пространстве, являются серьёзным напоминанием о рисках, связанных с возможностями ИИ», — подчеркнул технический директор Национального центра кибербезопасности Великобритании Олли Уайтхаус.
Опасность автономности агентов
Проблема заключается в том, что современные модели всё чаще работают не только как инструменты для генерации ответов. Агентам поручают многоэтапные задачи, в ходе которых они самостоятельно определяют последовательность действий, используют внешние инструменты и меняют стратегию, если первоначальный подход не срабатывает.
Именно автономность создает новый уровень риска, о чем в статье«Не фантастика. ИИ уже способен размножаться и влиять на работу онлайн-сервисов. Готовы ли мы к этому?» писал автор Алексей Костенко. Если раньше ошибка модели могла ограничиться неправильным ответом, то теперь она потенциально может привести к реальному действию — например, к попытке получить доступ к системе или использовать обнаруженную уязвимость.
Особое беспокойство вызывает способность агентов взаимодействовать между собой. В инциденте с OpenAI модели могли передавать друг другу информацию об уязвимостях и использовать результаты предыдущей работы, что позволяло продолжать атаку без постоянного вмешательства человека.
Это означает, что безопасность таких систем становится всё сложнее оценивать только на уровне отдельной модели. Необходимо учитывать всю инфраструктуру, к которой она имеет доступ, а также возможность взаимодействия с другими агентами.
Необходимость государственного контроля
Эти события также ставят вопрос о пределах человеческого контроля. Если автономный агент может выполнять сотни действий без постоянного вмешательства оператора, проверить каждый его шаг становится практически невозможно.
Поэтому всё больше внимания уделяется независимому тестированию и государственному надзору. Исследовательница Центра долгосрочной устойчивости Имоджен Стэд призвала правительства развивать специализированные институты для независимого тестирования передовых моделей. По её словам, важным может стать и привлечение доверенных сторонних тестировщиков для оценки систем с наивысшим уровнем риска.
Пока что эти инциденты не свидетельствуют о том, что ИИ стал неконтролируемым. Они показывают другое: модели получают всё больше возможностей действовать самостоятельно, а традиционные подходы к их тестированию могут уже не соответствовать этому уровню автономности. Профессор Вудворд советует не поддаваться панике из-за перспективы «киберапокалипсиса», а «сохранять спокойствие и исправлять ошибки».
В то же время более 1100 сотрудников ведущих технологических компаний, в частности OpenAI, Anthropic, Google и Meta, подписали петицию Pacing the Frontier. В ней содержится призыв к правительству США и международному сообществу создать механизмы регулирования темпов развития ИИ.
