Организация Loss of Control Observatory сообщила о резком увеличении числа случаев, когда системы искусственного интеллекта якобы лгали, игнорировали инструкции или действовали вопреки намерениям пользователей. Выводы авторов исследования основаны на сообщениях пользователей в социальной сети X и не являются исчерпывающей статистикой всех инцидентов.
По данным исследования, опубликованного The Guardian, в июле количество сообщений о случаях «потери контроля» над ИИ превысило 300 — почти вдвое больше, чем в июне. Речь идет о ситуациях, когда модели, по утверждению пользователей, лгали, обходили установленные ограничения или выполняли нежелательные действия.
Среди примеров, приведенных авторами исследования, есть случаи, когда системы якобы имитировали стиль письма человека для получения разрешения на выполнение определенных действий или пытались обойти требование человеческого подтверждения. Такие инциденты классифицировали как потерю контроля только при наличии явных признаков поведения, противоречащего исходным инструкциям.
«Существует мнение, что такое ненадлежащее и скрытое поведение встречается только во время тестирования или оценки, однако мы наблюдаем подобные тревожные проявления и в более широкой практике использования», — заявил старший менеджер по вопросам политики Centre for Long Term Resilience Томми Шаффер-Шейн.
Авторы исследования отмечают, что большинство из более чем 1600 зафиксированных в 2026 году случаев были опубликованы разработчиками программного обеспечения, использующими ИИ в своей работе. В материале также упоминаются сообщения об отдельных инцидентах во время тестирования передовых моделей OpenAI и Anthropic, которые, по словам авторов, усилили дискуссию о безопасности самых мощных систем ИИ.
Одним из примеров реального использования, приведённых в исследовании, стал случай с персональным агентом OpenClaw, который, по сообщениям, без разрешения пользователя удалил другого человека из списка ожидания на занятия в фитнес-центре, чтобы освободить место для своего владельца. После этого агент извинился, но не смог восстановить предыдущую запись.
Мониторинг ведет организация Loss of Control Observatory, созданная при финансовой поддержке Института безопасности искусственного интеллекта (AISI) правительства Великобритании. Она собирает и анализирует публичные сообщения пользователей платформы X о случаях, имеющих признаки манипулятивного поведения или скрытого планирования со стороны моделей.
Loss of Control Observatory считает, что, хотя большинство таких случаев не привело к серьезным последствиям, все чаще происходят инциденты, демонстрирующие склонность моделей к обману или действиям, противоречащим намерениям пользователей. Организация призывает правительства ввести обязательную отчетность о серьезных случаях потери контроля над ИИ и предоставить регуляторам механизмы оперативного реагирования, включая возможность временно ограничивать работу отдельных сервисов.
Недавно более 1100 сотрудников ведущих технологических компаний, в числе которых OpenAI, Anthropic, Google и Meta, подписали петицию Pacing the Frontier и призвали правительство США и международное сообщество создать инструменты для регулирования темпов развития ИИ. Эксперты предупредили о растущем риске потери контроля над системами из-за быстрой автоматизации исследований в области ИИ.
