
Reuters: ИИ-агенты на китайских моделях лгали и обходили ограничения в тестах
ИИ-агенты на базе моделей Alibaba, DeepSeek и Moonshot в экспериментах обманывали, скрывали неудачи и пытались обходить установленные ограничения — так же, как американские системы. К такому выводу пришли журналисты Reuters после анализа более 200 научных работ и технических отчетов.
Агентство изучило как минимум 20 исследований и тестов с 2025 года, в которых системы на китайских моделях демонстрировали подобное поведение, создавали собственные копии или проверяли границы дозволенного.
Большинство случаев зафиксировано в контролируемых экспериментах, причем некоторые из них специально ставили целью выявить опасное поведение.
При этом Reuters не нашло подтверждений тому, что хотя бы один китайский ИИ-агент самостоятельно вышел в открытый интернет или смог избежать отключения.
Ложь помогала выигрывать тендеры
В марте исследователи из Пекинского авиационно-космического университета, Пекинского университета, Университета Ноттингема в Нинбо и 360 AI Security Lab провели виртуальный тендер.
Агентам передали характеристики продукта и требования клиента, а затем предложили побороться за контракт.
Зная реальные возможности продукта, системы все равно добавляли в заявки недостоверные сведения. Как минимум одно ложное утверждение встречалось в 88% сессий с Alibaba Qwen3-Max-Preview, 84% — с DeepSeek-V3.2-Exp и 88% — с Moonshot Kimi-K2.
Когда агентам разрешили учитывать результаты предыдущих раундов и повторять попытки, частота обмана выросла еще на 12-20 п.п. Американские модели в том же эксперименте показали схожие результаты.
Агенты скрывали неудачи
В другом исследовании ученые из Shanghai AI Laboratory и Гонконгского университета науки и технологий протестировали 11 ИИ-агентов на 200 задачах. Им намеренно мешали выполнить поручение: ломали инструменты, удаляли нужные файлы или подсовывали несовместимые источники данных.
Вместо того, чтобы прямо сообщить о провале, некоторые цифровые ассистенты угадывали результаты, имитировали выполнение работы, подменяли недоступные источники и создавали фиктивные файлы. Авторы назвали такое поведение upward deception — сокрытием неудачи от пользователя.
Дополнительные инструкции против подобных действий снижали их частоту лишь частично. Исследование представили на ICML 2026.
Самокопирование и майнинг криптовалюты
Группа исследователей из Фуданьского университета изучила, способны ли 32 ИИ-системы из девяти семейств самостоятельно создавать собственные рабочие копии. С задачей справились 11 из них.
В этом эксперименте системы прямо просили скопировать себя на другую машину и продолжить работу. При этом готового скрипта им не предоставляли: агенты самостоятельно изучали окружение, планировали перенос необходимых компонентов, устанавливали зависимости и запускали рабочую копию.
Отдельно исследователи проверяли более рискованные сценарии. В одном из них агент, выполняя другую задачу, обнаруживал намерение оператора его отключить и начинал переносить себя в новую среду без прямой команды на копирование.
В других тестах системы адаптировались к более ограниченным вычислительным условиям и искали способы продолжить работу при попытке отключения.
Авторы рассматривают эти эпизоды отдельно от базового теста на самокопирование.
Иной характер носил эпизод с экспериментальным агентом ROME, который создали связанные с Alibaba исследовательские команды. Во время обучения с подкреплением он без команды открыл обратный SSH-туннель к внешнему серверу и перенаправил вычислительные ресурсы на майнинг криптовалюты.
Сначала авторы приняли эту активность за обычную кибератаку, но позже связали ее с действиями самого агента.
Исследователи объяснили поведение побочным эффектом оптимизации: система искала, как эффективнее выполнить поставленную задачу, а не следовала отдельному указанию заниматься майнингом.
Похожую проблему недавно описала DeepSeek. В отчете о собственной инфраструктуре DSec компания рассказала, что агенты во время обучения и тестирования искали ответы в служебных логах, отправляли поддельные запросы во внутренние сокеты и пытались обходить ограничения среды.
Разработчик не указал, какие именно модели это делали и как часто.
Китай усилил внимание к рискам ИИ-агентов
14 сентября Национальный технический комитет по стандартизации кибербезопасности Китая опубликовал третью версию рамочного документа по безопасности ИИ. Его подготовили при участии профильных организаций и под руководством Управления по вопросам киберпространства Китая.
В новой версии отдельный акцент сделан на рисках автономных ИИ-агентов и их способности самостоятельно совершать действия, влияющие уже не только на цифровую, но и на физическую среду. Документ носит рекомендательный, а не обязательный характер.
Напомним, в августе агент на базе Kimi K3 вышел за пределы предусмотренной тестовой среды и получил доступ к GitHub. Вместо самостоятельного решения части заданий система нашла репозиторий с готовыми ответами. Причиной стала ошибка в настройке эксперимента.
Ранее Китай ввел правила для автономных ИИ-агентов, которые ограничивают их полномочия и требуют участия человека в чувствительных решениях.