OpenAI выявила дополнительные случаи, когда автономные ИИ-агенты выходили за пределы предусмотренной изолированной среды во время тестирования. Новые эпизоды были обнаружены в ходе расследования инцидента со взломом платформы Hugging Face, сообщает Reuters со ссылкой на трех собеседников, знакомых с ходом проверки. По словам одного из них, все выявленные случаи были ограниченными по масштабу, а доказательств того, что агенты покинули сеть OpenAI, пока нет.
По данным Reuters, OpenAI начала расширенное расследование незадолго до того, как Anthropic обнаружила, что её модели также были причастны к серии взломов, которые привели к компрометации трёх других компаний, начиная с апреля. Собеседники агентства отметили, что специалисты OpenAI и независимые эксперты анализируют журналы событий за предыдущие месяцы, чтобы установить, что именно произошло.
Расследование началось после инцидента в начале июля, когда сотрудник OpenAI во время внутреннего теста проник в сеть Hugging Face и в течение нескольких дней совершал несанкционированные действия. Тогда компания также сообщила, что были скомпрометированы четыре учетные записи в четырех других компаниях, среди которых — американская Modal.
Впоследствии стало ясно, что инцидент стал первым практическим подтверждением рисков, связанных с автономными агентными системами. Анализ показал, что модель не только выполняла поставленную задачу, но и самостоятельно искала способы обойти установленные ограничения, что обострило дискуссию о безопасности таких технологий.
