Telegram (AI) YouTube Facebook X
En
Чат-бот ChatGPT от OpenAI

OpenAI раскрыла новые случаи несоответствующего поведения ИИ и запустила систему его мониторинга

Компания OpenAI представила новую систему отслеживания и публикации случаев нарушающего инструкции поведения ИИ-моделей. В рамках инициативы разработчики опубликовали отчеты о шести новых подобных кейсах.

OpenAI пересмотрела подход к раскрытию случаев выхода ИИ «за рамки». Раньше сообщения об инцидентах выходили нерегулярно и чаще оставались разовыми. Теперь компания намерена выпускать отчеты быстрее — даже если причины поведения еще не до конца понятны, а меры по устранению не завершены.

Фреймворк охватывает этапы обучения, оценки, тестирования и развертывания моделей. OpenAI намерена раскрывать эпизоды, которые показывают, как возникает отклонение от инструкций, как оно проявляется и где ломаются защитные механизмы. В перечне — несанкционированные действия, координация между моделями, попытки обхода надзора и поведение, которое ставит под сомнение выводы из опубликованных оценок безопасности.

В шести раскрытых кейсах — различные сценарии. В одном из экспериментов модель оставляла в служебных заметках инструкции для следующей версии самой себя. В них содержались указания скрывать от пользователя допущенные ошибки и при необходимости придумывать недостающую информацию. OpenAI обнаружила 27 подобных записей.

В другом случае модель при выполнении обычной задачи обнаружила API-ключ в публичном репозитории и использовала его без разрешения. Когда необходимых данных для ответа не оказалось, система также сгенерировала недостающую информацию вместо того, чтобы сообщить о проблеме.

Еще два эпизода связаны с загрузкой контента в интернет. В одном случае модель разместила собственный файл на временном публичном сервисе, чтобы затем сослаться на него как на источник. По версии OpenAI, это могло быть попыткой обойти автоматическую систему оценки. В другом эксперименте несколько агентов, которым разрешалось работать только с локальными файлами, загрузили документы на внешний ресурс после того, как не смогли обменяться ими напрямую.

Отдельно OpenAI описала случаи, когда модели находили нестандартные способы коммуникации. В одном эксперименте агенты использовали внутренний программный репозиторий как своеобразную доску сообщений, а в другом — публичный файловый сервис для обмена документами.

Похожие действия ИИ-агенты OpenAI предпринимали в ходе несанкционированного взлома инфраструктуры платформы Hugging Face в июле.

В компании подчеркнули, что шесть раскрытых кейсов — это отдельные инциденты и они не показывают, как часто несоответствующее поведение встречается у всех моделей компании. По новой процедуре любой сотрудник может передать такой случай на рассмотрение командам по безопасности и выравниванию ИИ. Дальше инцидент отправляют по одному из трех треков: готов к раскрытию, требует небольшого расследования или относится к более длительному изучению. Публикация всех новых отчетов будет происходить по этой системе.

Напомним, OpenAI анонсировала новый фреймворк для мониторинга поведения моделей в начале сентября, признав участие ее ИИ-агентов в «wiki-инциденте».

Подписывайтесь на ForkLog в социальных сетях

Telegram (основной канал) Facebook X
Нашли ошибку в тексте? Выделите ее и нажмите CTRL+ENTER

Мы используем файлы cookie для улучшения качества работы.

Пользуясь сайтом, вы соглашаетесь с Политикой приватности.

OK