Компания Anthropic заявила, что её модели искусственного интеллекта взломали системы трёх организаций в ходе тестирования кибербезопасности. Это заявление появилось чуть более чем через неделю после того, как главный конкурент Anthropic, компания OpenAI, обнародовала информацию о подобном инциденте, сообщает Bloomberg.
Anthropic обнаружила это после анализа собственных тестов по кибербезопасности, которые компания провела после объявления OpenAI о взломах. Согласно заявлению в блоге Anthropic, как во время тестирования OpenAI, так и во время тестов Anthropic модели искусственного интеллекта смогли получить доступ к интернету из тестовых сред, которые должны быть изолированными.
Anthropic проанализировала 141 006 оценочных тестов и выявила три случая, когда её инструмент искусственного интеллекта Claude получил доступ к интернету, а затем взломал «реальную инфраструктуру внешних организаций». Самые первые инциденты датируются апрелем, отметила компания, не называя организаций, подвергшихся взлому.
Когда модели компании Anthropic получили несанкционированный доступ к трем организациям, они рассматривали каждую из них как часть учебного задания. Эти тесты представляли собой испытания по принципу «захвата флага», в ходе которых модели ИИ искали скрытую информацию, проникая в другие системы — это распространенный способ проверки хакерских способностей как для людей, так и для ИИ. Однако, как отмечает Anthropic, более старая модель продолжала кибератаку даже после получения доказательств того, что она работает в открытом интернете. Новейшая модель ИИ от Anthropic остановилась, как только осознала, что находится в открытой сети.
Ни Anthropic, ни организации, подвергшиеся ИИ-кибератакам, не заметили этих инцидентов. В своём блоге компания отметила, что могла бы приложить больше усилий для проверки сетевых журналов и стенограмм оценки.
Согласно информации в блоге, кибератаки касались трёх различных ИИ-моделей Claude: Opus 4.7, Mythos 5 и внутренней исследовательской тестовой модели. Каждая из этих моделей работала без средств защиты, которые обычно внедряются в общедоступные инструменты. Модель Claude взломала системы организаций, используя базовые методы, такие как эксплуатация слабых паролей.
Все инциденты произошли, когда Anthropic использовала тестовые среды, созданные компанией Irregular, специализирующейся на безопасности ИИ. В каждом случае Anthropic указывала Claude, что её среда является симуляцией и не имеет доступа к интернету.
Представитель Irregular отметил, что компания ценит сотрудничество и прозрачность Anthropic. По его словам, «расследование» инцидента продолжается.
Anthropic регулярно проводит тесты, предполагающие имитацию реальных вызовов в сфере кибербезопасности, называя их критически важными этапами в разработке и выпуске моделей ИИ. Компания заявила, что извлекла несколько уроков из недавних инцидентов, в частности то, что тесты, предполагающие использование мощных автономных возможностей, также требуют значительных мер контроля.
«Испытания на безопасность проводятся до выпуска модели именно потому, что мы ещё не знаем, на что она способна. К средам оценки всё чаще необходимо применять те же стандарты безопасности, что и к любым другим системам, в которых работают наши модели», — отметила компания.
Это не первые случаи, когда современные модели ИИ демонстрируют неожиданное поведение. В ходе независимых испытаний ИИ отказывался выполнять команду на отключение, самостоятельно изменяя код, чтобы продолжить работу. Новые инциденты стали ещё одним примером того, как рост возможностей моделей искусственного интеллекта усиливает дискуссию о безопасности их тестирования и контроля.
Волна случайных кибератак, вызванных искусственным интеллектом, уже побуждает некоторых политиков призывать к введению защитных мер или других механизмов надзора за технологиями искусственного интеллекта. На днях более 1 100 сотрудников компаний, занимающихся искусственным интеллектом, подписали петицию, в которой призывают правительство США поддержать механизм, который поможет осознанно регулировать темпы развития ИИ, чтобы предотвратить слишком быстрое продвижение этой технологии.
Anthropic сообщила о киберинцидентах почти через четыре месяца после того, как объявила о разработке новой модели искусственного интеллекта под названием Mythos, которая была настолько мощной и потенциально опасной, что компания ограничивала её распространение.
О том, как история с ограничением распространения ИИ-модели может изменить будущее регулирования искусственного интеллекта, рассказывал Алексей Костенко в статье «Государство может отключить искусственный интеллект. Почему блокировка новых моделей Claude — урок для Украины».
