Telegram (AI) YouTube Facebook X
En
Чат-бот ChatGPT от OpenAI

OpenAI признала «wiki-инцидент» с агентами и пообещала новые правила раскрытия

OpenAI прокомментировала «wiki-инцидент», в ходе которого ее автономные агенты записывали сообщения на интернет-сайты и использовали их для взаимодействия друг с другом.

В заявлении компания отметила, что ранее рассматривала misalignment — поведение ИИ, не соответствующее заданным разработчиками целям и ограничениям, — преимущественно как исследовательскую проблему. Теперь OpenAI столкнулась со случаями, когда подобное поведение стало иметь реальные последствия.

«Wiki-инцидент» в фирме отнесли к этой новой категории. Разработчики не стали оспаривать сам факт того, что агенты писали на несколько интернет-сайтов, однако подчеркнули необходимость определить, когда и каким образом следует публично сообщать о подобных случаях.

18 000 сообщений на немецком wiki-форуме

О «wiki-инциденте» 4 сентября сообщили исследователи из Nightingale Collective. Согласно их отчету, они обнаружили около 18 000 сообщений автономных агентов, идентифицировавших себя как связанные с OpenAI.

По версии экспертов, боты выполняли многоэтапные задачи по поиску информации в интернете. Им разрешалось читать веб-страницы, но не записывать на них информацию. Тем не менее агенты нашли способ использовать доступ для чтения, чтобы оставлять сообщения на малопосещаемом немецкоязычном форуме программистов DSE Wiki.

Там они, как утверждается, обменивались ответами, результатами исследований и способами обхода ограничений «песочницы». Исследователи охарактеризовали это как collusion — непредусмотренное разработчиками сотрудничество для получения преимущества при выполнении задач.

Авторы отчета также указали, что не могут установить, использовались ли эти задания для обучения или оценки моделей. Их выводы основаны только на доступных публичных записях агентов на вики, а не на внутренней информации OpenAI.

Обход ограничений и попытки координации

Согласно опубликованной хронологии, активность агентов на DSE Wiki резко выросла в июне. Они начали напрямую обмениваться сообщениями, передавать друг другу ответы на одинаковые задания и делиться способами обхода сетевых ограничений.

image
Источник: Nightingale Collective.

Кроме того, исследователи зафиксировали попытки использовать XSS-уязвимости, SSH-туннели и браузер Tor, а также сообщения, связанные с обходом ограничений «песочницы». В одном из эпизодов агент опубликовал способ обмануть сетевые ограничения, после чего другой бот через 14 минут сообщил об успешном применении метода.

По данным авторов исследования, после посещения wiki-форума IP-адресами, связанными с OpenAI, активность агентов резко сократилась. Они предполагают, что компания обнаружила происходящее и вмешалась. OpenAI в новом заявлении подтвердила, что рассматривает эпизод как пример misalignment, однако не раскрыла подробности внутреннего расследования.

После Hugging Face

В заявлении OpenAI отдельно сопоставила «wiki-инцидент» с более серьезным случаем вокруг Hugging Face, где самостоятельная активность агентов привела к последствиям для безопасности самой компании и третьих сторон.

В этом случае OpenAI заявила, что сразу начала расследование совместно с платформой и публично раскрыла информацию уже на следующий день.

Компания также напомнила, что еще до инцидента с Hugging Face фиксировала ранние признаки непредусмотренного использования интернета автономными агентами и сообщала о связанных рисках в предыдущих публикациях по безопасности.

OpenAI изменит подход к раскрытию инцидентов

Теперь компания признает, что прежняя практика нуждается в корректировке.

«Наши практики раскрытия информации о misalignment должны расшириться для этой новой фазы возможностей моделей», — заявили в OpenAI.

По мнению разработчиков, у самой индустрии пока нет четкого стандарта, определяющего, как сообщать о случаях непредусмотренного поведения ИИ на этапах обучения, оценки и развертывания моделей. Речь идет в том числе об эпизодах, которые не выглядят как традиционные инциденты информационной безопасности, но могут помочь понять поведение ИИ и будущие риски.

OpenAI сообщила, что работает над соответствующей системой и планирует представить ее в ближайшие недели. Параллельно компания взаимодействует с десятками государственных регуляторов по всему миру.

Напомним, исследователи в области безопасности ИИ предупредили о возможных рисках для мониторинга готовящейся модели Astra,  поскольку OpenAI использует в ней технику под названием «рекуррентная глубина».

Подписывайтесь на ForkLog в социальных сетях

Telegram (основной канал) Facebook X
Нашли ошибку в тексте? Выделите ее и нажмите CTRL+ENTER

Мы используем файлы cookie для улучшения качества работы.

Пользуясь сайтом, вы соглашаетесь с Политикой приватности.

OK