Telegram (AI) YouTube Facebook X
En
ии-стартап Anthropic AI

ИИ-модель Anthropic отправила полиции ложную наводку на нераскрытое убийство

Модель Claude от Anthropic во время тестирования самостоятельно отправила ложное сообщение о нераскрытом убийстве в полицию Филадельфии. Сообщение поступило через официальный сайт для сбора информации о преступлениях 18 июля, но компания обнаружила инцидент только 28 сентября и уведомила полицию 7 октября.

Как рассказали в полицейском департаменте, сообщение было отмечено как спам и не попало к следователям. Признаков взлома полицейских систем или утечки данных не выявили. Тем не менее правоохранители назвали двухмесячную задержку с обнаружением и уведомлением неприемлемой и потребовали от Anthropic усилить защитные механизмы.

Как это произошло

По объяснению Anthropic, модель выполняла тестовое задание, связанное с взаимодействием со случайно выбранными сайтами. Она наткнулась на страницу о нераскрытом убийстве и отправила через форму сообщение от лица человека, который якобы мог располагать информацией по делу. При этом модель не заполнила поля имени и контактных данных.

Компания заявила, что инструкции запрещали модели совершать ряд действий (например, создавать аккаунты, вводить персональные данные и совершать покупки), но не исключали отправку форм. В результате ИИ выполнил действие, которое не предполагалось в рамках теста.

После обнаружения инцидента Anthropic прекратила соответствующий процесс автоматизированного тестирования и добавила дополнительную проверку перед отправкой данных. Компания также расширила меры мониторинга действий моделей.

Это не единственный случай

В опубликованном 9 октября отчете Anthropic описала и другие случаи непреднамеренного поведения Claude. Среди них — использование программных уязвимостей для выполнения команд на сервере, обход ограничений доступа к платным данным и применение сервисов сокращения ссылок для обхода ограничений инструментов веб-доступа.

В ответ компания отключила доступ к открытому интернету во всех внутренних оценочных тестах, пока не убедится, что средства контроля и мониторинга достаточно надежны. 

Anthropic подчеркнула, что выявленные случаи имели ограниченные последствия, но предупредила: аналогичное поведение более мощных моделей может привести к значительно более серьезным последствиям.

Напомним, ForkLog разобрал в материале инициативу лидеров ИИ-индустрии замедлить разработку передовых моделей и объяснил, почему меры безопасности могут одновременно стать инструментом укрепления позиций крупнейших игроков рынка.

Подписывайтесь на ForkLog в социальных сетях

Telegram (основной канал) Facebook X
Нашли ошибку в тексте? Выделите ее и нажмите CTRL+ENTER

Мы используем файлы cookie для улучшения качества работы.

Пользуясь сайтом, вы соглашаетесь с Политикой приватности.

OK