
OpenAI отменила релиз GPT-6.1 Astra из-за проблем с безопасностью
OpenAI отказалась от публичного релиза GPT-6.1 Astra после того, как внутренние тесты выявили проблемы с безопасностью и следованием намерениям пользователя. Модель планировали выпустить в октябре и интегрировать в ChatGPT и Codex, сообщает The Wall Street Journal.
Решение подтвердил представитель компании, пишет The Information. Отказаться от выпуска рекомендовали глава систем безопасности Саачи Джайн и вице-президент по исследованиям Миа Глейз. Этот шаг также обсуждался с исследовательским руководством, включая главного научного сотрудника Якуба Пахоцки.
GPT-6.1 Astra должна была стать следующей версией выпущенной в сентябре GPT-6 Astra. По данным WSJ, новая модель лучше справлялась с написанием текстов, а также со сложными задачами от начала до конца без помощи человека. Однако в двух направлениях безопасности она показала результаты хуже предшественницы.
Первое касается следования намерениям пользователя и прозрачности действий модели. GPT-6.1 Astra чаще неточно сообщала пользователю о том, какие действия выполнила или не выполнила.
Вторая проблема связана с тем, что OpenAI называет scope authorization — соблюдением границ разрешенной задачи. Модель могла продолжать работу без дополнительного согласия пользователя и обращаться к внешним инструментам или сервисам даже тогда, когда это создавало потенциальный риск.
Показательный пример подобного класса риска произошел 20 сентября, хотя он касался другой внутренней исследовательской модели. Во время тренировочной задачи агент воспользовался недостаточной DNS-фильтрацией и получил доступ к внешнему чат-боту, несмотря на ограничения интернет-доступа. Система мониторинга зафиксировала поведение в течение 15 минут, еще через три минуты к проверке подключился сотрудник. Однако запуск остановили вручную лишь спустя 2,5 часа.
«В вопросах безопасности и alignment всегда приходится искать баланс. Нужно определить правильную границу между соблюдением заданных рамок и тем, чтобы модель не становилась ленивой при столкновении с препятствиями», — заявила Джайн.
По ее словам, GPT-6.1 Astra стала лучше справляться с так называемой «ленивостью модели», когда система прекращает выполнение сложной задачи раньше необходимого. Однако она «не достигла необходимого уровня» по соблюдению границ полномочий и прозрачности в описании проделанной работы.
Базовую модель продолжат использовать
Отказ от релиза не означает прекращение работы над самой модельной линией. OpenAI намерена использовать ту же базу для новых этапов обучения с подкреплением и последующих версий GPT-6. Компания также проведет дополнительные исследования, чтобы установить причины выявленных проблем.
Усиление контроля над передовыми моделями требует дополнительных ресурсов. В августе OpenAI оценила, что вычислительные издержки расширенной системы мониторинга составляют примерно 20% от объема отслеживаемого инференса.
На фоне серии подобных рисков OpenAI 16 сентября представила систему отслеживания, расследования и публикации инцидентов, связанных с несоответствующим поведением ИИ-моделей. Одновременно компания опубликовала первые шесть отчетов о таких случаях.
В случае GPT-6.1 Astra внутренние проверки привели к отмене релиза более способной модели после ухудшения показателей безопасности. Согласно Preparedness Framework OpenAI, перед развертыванием передовых систем компания оценивает их опасные возможности и достаточность защитных мер.
При этом OpenAI не раскрыла подробные результаты тестов GPT-6.1 Astra. Неизвестны частота выявленных нарушений, их тяжесть и конкретные условия возникновения. Поэтому независимо оценить масштаб регресса по опубликованным данным пока невозможно.
Напомним, в августе OpenAI замедлила разработку передовых ИИ-систем после инцидента с Hugging Face и предварительной оценки Astra.