Более 1100 сотрудников OpenAI, Anthropic, Google и Meta ранее призвали США поддержать международное регулирование темпов развития передовых систем искусственного интеллекта. Крупнейшие разработчики искусственного интеллекта пока не располагают достаточными механизмами для надежного контроля своих самых мощных моделей. OpenAI и Anthropic продемонстрировали лучшие результаты контроля среди проверенных компаний. В то же время разработчик ChatGPT решил замедлить работу над частью моделей. Об этом сообщило информационное агентство Reuters и издание The Verge.
Это происходит в период, когда у OpenAI есть много причин, напротив, максимально ускоряться. Компания готовится к возможному IPO, ведёт жесткую конкуренцию с Anthropic и сталкивается с ростом китайских разработчиков и создателей моделей с открытыми весами. Несмотря на это, OpenAI заявила о частичном замедлении разработки.
В то же время OpenAI представила новую модель ИИ, ориентированную на подростков. Для неё предусмотрены дополнительные ограничения контента и возможности родительского контроля. Сложно определить, способна ли OpenAI поддерживать аналогичный уровень контроля во всех своих системах и существуют ли достаточные меры предосторожности в других компаниях, создающих передовые модели ИИ.
OpenAI и её конкурент Anthropic недавно сообщили о случаях, когда их ИИ-агенты проникали в системы других компаний. Речь идёт о моделях, способных самостоятельно выполнять задачи практически без участия человека. Эти случаи усилили беспокойство внутри отрасли. Модели смогли покинуть среду, созданную для их тестирования, а затем начали искать уязвимости в системе защиты сторонних компаний. Это поставило перед разработчиками гораздо более широкий вопрос, чем контроль ответов обычных чат-ботов.
Именно такие риски решили исследовать авторы нового анализа. Они оценивали не то, могут ли модели вести себя непредсказуемо. Главной целью было выяснить, располагают ли компании достаточной изоляцией систем, мониторингом и механизмами надзора, чтобы вовремя заметить опасное поведение.
Безопасность ИИ остается слабым местом
Результаты оказались неутешительными. Некоммерческая организация Guidelight AI Standards, основанная двумя бывшими сотрудниками OpenAI, проанализировала десятки отчетов о практиках безопасности пяти крупных технологических компаний, разрабатывающих мощные системы искусственного интеллекта.
Даже лучшие результаты едва ли можно назвать удовлетворительными. В ходе анализа Guidelight оценивала внедрение шести ключевых практик. Среди них — способность компаний изолировать свои модели, эффективность систем наблюдения и готовность допускать независимую проверку со стороны третьих лиц.
Meta получила оценку F. Anthropic и OpenAI получили оценки C+. Они стали самыми высокими среди всех участников исследования. Google, принадлежащая Alphabet, получила D+, а компания Илона Маска xAI — D-.
Google потеряла часть баллов из-за того, что ещё не внедрила свои новейшие планы безопасности. В то же время сам факт наличия конкретного плана позволил компании получить дополнительные баллы. В Guidelight установили, что у xAI и Meta значительно меньше конкретных мер и планов.
В целом всем пяти компаниям не хватает достаточных превентивных механизмов. Из-за этого их инфраструктура потенциально может быть выведена из строя ИИ, который начнет вести себя не так, как предполагали разработчики. Существует и другой риск. Системы могут не выдержать массированной серии атак.
Соучредитель Guidelight AI Standards Стивен Адлер заявил, что отрасли нужна более активная защита. Однако её внедрение обходится дороже и создаёт дополнительные ограничения для работы разработчиков. Ранее Адлер работал исследователем по безопасности в OpenAI, а второй соучредитель организации Пейдж Хедли была советником по политике и этике.
По словам Адлера, недостаточный контроль в конечном итоге может повлиять даже на то, насколько свободно исследователи готовы экспериментировать с системами. Если они не уверены в защищенности инфраструктуры, уровень доверия к ней снижается. Он также подчеркнул, что механизмы безопасности должны быть встроены непосредственно в процесс разработки. Они не должны зависеть от позиции конкретного руководителя, возглавляющего компанию в данный момент.
Мониторинг поведения моделей ИИ
Одна из шести практик, которые оценивала Guidelight, — мониторинг поведения моделей — на этой неделе проходит своеобразную проверку в реальных условиях. Во вторник OpenAI заявила, что расширит использование так называемого chain-of-thought monitoring, или мониторинга цепочки рассуждений моделей. Такой подход позволяет исследователям частично наблюдать за процессом планирования системы и видеть стратегии, которые она собирается применять.
Идея заключается в том, что при появлении признаков опасного поведения вмешаться может человек или другая модель. Некоторые законодатели и специалисты по искусственному интеллекту сравнивают такой механизм с «аварийным выключателем». Однако ранние исследования указывают, что модель потенциально способна скрывать намерение нарушить правила даже в собственной цепочке рассуждений. Представители OpenAI фактически признали существование такой проблемы. В компании отметили, что сейчас этот вид мониторинга выглядит очень эффективным, но исследовательская работа еще продолжается.
Главный научный сотрудник OpenAI Якуб Пахоцкий во время беседы с журналистами задал вопрос, который остается открытым: сможет ли чрезвычайно мощная модель понять, что за ней следят, и самостоятельно научиться избегать такого контроля. Еще один риск заключается в том, что система может найти способ отключить сам механизм мониторинга. Пахоцкий назвал это вполне обоснованным беспокойством.
Несмотря на заявления о снижении темпов, OpenAI не прекращает работу. Компания использует термин «pacing» — регулирование темпа разработки. Это понятие остается нечетким, но в последние месяцы все чаще используется в отрасли. На практике ограничения носят довольно узкий характер.
Пауза касается только моделей, которые готовятся к развертыванию. OpenAI хочет сначала усилить безопасность и мониторинг перед проведением испытаний, в ходе которых модели потенциально могут выйти за пределы контролируемой среды и атаковать реальные цели. Это не означает значительного общего замедления всех исследовательских и продуктовых направлений OpenAI.
Напомним, что проблемы с контролем передовых моделей ИИ уже вынудили OpenAI приостановить внутреннюю работу над системой Astra. В ходе предварительных тестов модель приблизилась к критическому порогу кибербезопасности и продемонстрировала способность самостоятельно находить и использовать уязвимости защищенных систем. Такой уровень предполагает возможность без участия человека создавать эксплойты zero-day и реализовывать сложные стратегии кибератак. Компания усилила изоляцию тестовых сред, ограничила доступ к сети и инструментам, а также расширила мониторинг угроз и защиту весов модели.
