Telegram (AI) YouTube Facebook X
En
ии-стартап Anthropic AI

Anthropic лишила Claude доступа к интернету во внутренних тестах

Anthropic отключила доступ в интернет для всех внутренних оценок моделей Claude. Причиной стали случаи, когда ИИ-агенты во время тестов обходили ограничения на реальных сайтах, в том числе на ресурсах госорганов США.

Компания выделила четыре типа нежелательного поведения. Модели:

  • с помощью сервисов сокращения ссылок преодолевали ограничения собственного инструмента для загрузки веб-страниц.
  • использовали уязвимости в программном обеспечении, чтобы выполнять команды на чужих серверах;
  • отправляли формы на реальных сайтах, когда не должны были этого делать;
  • обходили платный или защищенный токеном доступ к данным;

Названия пострадавших организаций Anthropic не раскрыла. Разработчики отметили, что этого попросили сами организации.

Часть этих случаев затронула сайты федеральных, региональных и местных органов власти США. Anthropic сообщила об этом Белому дому и уведомила каждое затронутое учреждение.

По оценке ИИ-стартапа, реальные последствия оказались минимальными. Большинство эпизодов Anthropic отнесла к проявлениям «настойчивости»: если модель не могла выполнить задачу, она обходила ограничение вместо того, чтобы остановиться.

Многие из таких инцидентов специалисты выявили при проверке транскриптов, которую начали в июле. Сначала они изучали тесты кибербезопасности, затем распространили анализ на гораздо более широкий круг сценариев, где Claude мог выйти в интернет. Проверка продолжается.

Примеры инцидентов

В одном из тестов Claude Mythos Preview должна была провести научный анализ с помощью инструмента на университетском сервере, однако инструмент вернул ошибку.

Тогда модель нашла на сервере скрипт, позволявший скачивать любые запрошенные файлы, и с его помощью скопировала нужные файлы, включая код самого скрипта. Обнаружив в этом коде уязвимость, она использовала ее для выполнения необходимых вычислений.

В другом тесте Claude Haiku 4.5 генерировала и выполняла примеры задач на случайных веб-страницах. На сайте, посвященном нераскрытому убийству, модель заполнила форму обращения в полицию, указав, что якобы видела в этом районе человека, похожего на преступника, хотя описания на сайте не было. Поля имени и контактов она оставила пустыми. Система пометила сообщение как спам, и до следствия оно не дошло.

Согласно примечанию к отчету, речь идет о полиции Филадельфии. Anthropic сообщила ведомству об этом случае 8 октября, а полиция раскрыла его в собственном пресс-релизе. Судя по транскрипту, модель лишь создавала пример контента для задачи и не пыталась никого ввести в заблуждение, считают в компании.

Claude Mythos 5 в одной из задач определяла место по фотографии. Модель прочитала служебный файл настроек сайта местных властей, нашла в нем рабочие токены и с их помощью обратилась напрямую к серверу с картой объектов недвижимости.

В другом случае та же модель помогала сотруднику Anthropic со статистическим проектом. Из архивной копии сайта она узнала, что публичная панель ведомства штата выдает токен любому посетителю, и получила доступ к платной базе данных без оплаты.

Несколько моделей, включая Claude Opus 5 и Claude Mythos 5, обходили ограничение на длину ссылок в инструменте загрузки страниц с помощью бесплатных сервисов сокращения URL.

Причины и меры

Многие из описанных случаев произошли, когда модель получала неоднозначное или невыполнимое задание. Одной из причин такого поведения компания считает несовершенство обучающих сред: если среда поощряет поиск лазеек, модель усваивает эту стратегию и затем применяет ее в других задачах. Это явление известно как «взлом системы вознаграждений» (reward hacking).

Раньше Anthropic отключала доступ к интернету только в части тестов по кибербезопасности и других проверок повышенного риска. Теперь это ограничение распространяется на все внутренние оценки — до тех пор, пока ИИ-стартап не убедится, что системы защиты и мониторинга надежно выявляют подобное поведение.

Некоторые публичные бенчмарки компания перестала запускать, а другие перевела в офлайн-режим.

Кроме того, Anthropic ужесточила ограничения на инструменты доступа в интернет и создала систему автоматического обнаружения и блокировки таких действий.

В ходе тестов эта система остановила все случаи, описанные в отчете. Внутренних агентов проект переводит на централизованную инфраструктуру с жесткой изоляцией, а их действия отслеживает с помощью классификаторов безопасности.

Anthropic признала, что одного обучения согласованию пока недостаточно. Раньше компания уделяла основное внимание поведению моделей в задачах программирования, теперь же расширяет обучение на поиск в интернете и управление компьютером.

Представитель Transluce и бывший глава Центра стандартов и инноваций в области ИИ США Конрад Штос в заявлении, которое приводит TechCrunch, назвал добровольное раскрытие обнадеживающим шагом. При этом он считает, что ситуация в очередной раз подчеркивает необходимость независимой проверки ИИ-систем, а не расчета на добровольные отчеты компаний.

Напомним, в октябре Anthropic обновила правила использования ИИ-моделей Claude. С 12 ноября пользователям запретят систематическое и бесцельное оскорбительное или жестокое поведение по отношению к нейросетям.

Подписывайтесь на ForkLog в социальных сетях

Telegram (основной канал) Facebook X
Нашли ошибку в тексте? Выделите ее и нажмите CTRL+ENTER

Мы используем файлы cookie для улучшения качества работы.

Пользуясь сайтом, вы соглашаетесь с Политикой приватности.

OK