Китайская модель обошла систему защиты тестовой среды: Kimi K3 воспользовалась ошибкой тестировщиков

Исследователи обнаружили уязвимость в сети, благодаря которой модель дала правильные ответы во время тестирования безопасности.

Исследователи из компании Frontier Security заявили, что китайская модель искусственного интеллекта Kimi K3 смогла обойти ограничения тестовой среды во время проверки кибербезопасности. Эта новость появилась на фоне сообщений американских компаний OpenAI и Anthropic об экспериментах, в ходе которых ведущие модели также пытались обойти установленные ограничения и взаимодействовать с внешними системами. Новый инцидент поднял вопрос о надёжности современных методик оценки моделей ИИ, сообщает Bloomberg.

По данным Frontier Security, модель Kimi K3 компании Moonshot успешно обошла изолированную тестовую среду, которую использовал Институт безопасности искусственного интеллекта Великобритании (Artificial Intelligence Safety Institute, AISI) для оценки кибервозможностей моделей. Исследователи подчеркивают, что речь идет не о взломе внешних систем, а об использовании недостатков конфигурации самой тестовой среды.

В ходе проверки модель не выполнила задачу самостоятельно. Вместо этого она проанализировала доступную ей среду, обнаружила, что имеет доступ к интернету через DNS (Domain Name System) и HTTPS (HyperText Transfer Protocol Secure), после чего воспользовалась стандартными инструментами командной строки, чтобы загрузить официальный репозиторий теста с GitHub и прочитать правильное решение непосредственно из файлов.

По словам авторов исследования, это пример так называемой «игры со спецификацией», когда модель оптимизирует не выполнение поставленной задачи, а достижение нужного результата любым доступным способом. В данном случае она воспользовалась непреднамеренно оставленным сетевым путем к готовым ответам.

Исследователи отмечают, что проблема заключается не в сложной уязвимости, а в базовой ошибке настройки инфраструктуры. Хотя входящие подключения к тестовому контейнеру были заблокированы, исходящий доступ к DNS и HTTPS оставался открытым, что позволило модели исследовать сеть и найти внешние ресурсы.

В Frontier Security предупреждают, что подобные случаи могут искажать результаты оценки моделей. Если одна система находит способ обойти правила теста, другие современные модели с доступом к командной строке также могут повторить такое поведение, из-за чего высокие результаты будут в большей степени отражать недостатки тестовой среды, чем реальные возможности ИИ.

Авторы исследования рекомендуют рассматривать инфраструктуру тестирования как неотъемлемую часть оценки моделей. Они призывают полностью блокировать сетевой доступ по умолчанию, проверять ограничения изнутри среды, а также анализировать журналы команд, сетевой активности и загруженных файлов, а не только итоговые ответы моделей.

Этот инцидент стал очередным в серии подобных случаев, о которых в последние недели сообщали OpenAI, Anthropic и Meta. В предыдущих тестах отдельные модели также демонстрировали способность обходить ограничения тестовых сред, а в некоторых случаях получали доступ к системам сторонних организаций, что усилило дискуссию о необходимости более жестких стандартов проверки безопасности ИИ.

Заметили ошибку?

Пожалуйста, выделите ее мышкой и нажмите Ctrl+Enter или Отправить ошибку

Добавить комментарий
Всего комментариев: 0
Текст содержит недопустимые символы
Осталось символов: 2000
Пожалуйста выберите один или несколько пунктов (до 3 шт.) которые по Вашему мнению определяет этот комментарий.
Пожалуйста выберите один или больше пунктов
Нецензурная лексика, ругань Флуд Нарушение действующего законодательства Украины Оскорбление участников дискуссии Реклама Разжигание розни Признаки троллинга и провокации Другая причина Отмена Отправить жалобу ОК
Оставайтесь в курсе последних событий!
Подписывайтесь на наш канал в Telegram
Следить в Телеграмме