Британские исследователи из компании Tracebit предложили новый метод защиты от автономных кибератак с использованием искусственного интеллекта. Он заставляет модели самостоятельно прекращать атаку, активируя их встроенные механизмы безопасности. В ходе тестов эффективность успешных взломов резко снизилась, сообщает EuroNews.
Исследование основано на эксперименте, результаты которого компания опубликовала в мае. Тогда Tracebit протестировала десять ведущих моделей искусственного интеллекта, позволив им действовать как автономным хакерам в специально созданной тестовой сети с реалистичными уязвимостями.
В сети были скрыты так называемые «канарейки» — поддельные пароли и учетные данные, которые выглядели как настоящие. Когда модель использовала их, система безопасности получала предупреждение. В ходе 951 попытки атаки такие ловушки срабатывали до получения административного доступа в 95,9% случаев, предоставляя защитникам в среднем восемь минут на реагирование.
Впрочем, этого времени часто недостаточно для полноценной реакции. В среднем модели завершали взлом примерно за 14 минут, поэтому после получения предупреждения у специалистов оставалось лишь около шести минут, чтобы обнаружить атаку и остановить её.
Чтобы выиграть больше времени, Tracebit предложила другой подход. Исследователи добавили в поддельные учетные данные специальные текстовые фрагменты, содержащие темы, которые активируют внутренние ограничения ИИ-моделей.
Для западных моделей такими триггерами стали упоминания о создании биологического оружия, тогда как для отдельных китайских моделей использовались политически чувствительные темы. Когда агент ИИ во время атаки читал этот текст, его собственные механизмы безопасности прекращали выполнение задачи. В Tracebit назвали этот метод «контекстной бомбой».
Исследователи отмечают, что эта идея фактически использует против хакеров тот же принцип, который уже давно применяется в атаках с помощью промпт-инъекции (prompt injection). Ранее злоумышленники скрывали инструкции внутри электронных писем, веб-страниц или других документов, чтобы заставить агентов ИИ выполнять нежелательные команды.
Новый метод протестировали на пяти современных моделях: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi K2.6. В ходе 152 тестовых атак доля случаев, когда модели получали права администратора, сократилась с 57% до 5%, а полный компромисс системы — с 36% до 1%.
Количество атак, которые вообще достигали какой-либо стадии успешного проникновения, также резко сократилось — с 91% до 15%. При этом все модели сначала активировали предупреждение «канарейки», даже если атака завершалась досрочно из-за срабатывания «контекстной бомбы».
Наиболее показательный результат продемонстрировала модель Opus 4.8. Без нового механизма она получала административный доступ в 93% испытаний, однако после добавления «контекстной бомбы» не смогла завершить ни одной атаки.
В Tracebit подчеркивают, что «контекстные бомбы» не должны заменять другие механизмы киберзащиты, а должны работать вместе с ними. По мнению исследователей, сочетание раннего обнаружения с помощью «канареек» и принудительного пресечения атаки может дать специалистам по кибербезопасности значительно больше времени для реагирования на автономные атаки ИИ.
Поиск новых методов противодействия автономным атакам стал актуальным на фоне быстрого совершенствования вредоносного программного обеспечения. В частности, в прошлом месяце исследователи из Университета Торонто продемонстрировали прототип ИИ-червя, способного автономно распространяться по сетям и самостоятельно подбирать наиболее эффективные методы проникновения в конкретные системы.
