Telegram (AI) YouTube Facebook X
En
Microsoft

Microsoft представила ИИ-модель на базе Qwen

Microsoft выпустила Microsoft-Decision-1 — модель для маршрутизации, классификации, приоритизации, проверки данных и управления рабочими процессами. В ее основе лежит открытая Qwen3.5-9B от Alibaba.

В отличие от больших языковых моделей, которые генерируют текст и рассуждают, модели принятия решений выдают структурированный ответ. Программа может сразу выполнить действие на его основе.

Microsoft-Decision-1 получает фиксированный набор вариантов и присваивает каждому откалиброванную вероятность.

Нейросеть поддерживает ответы «да/нет», выбор из нескольких вариантов и рейтинги. Она также оценивает ответы ИИ и действия агентов по заданным критериям.

Разработчики дообучили Qwen3.5-9B для быстрой оценки в один проход.

В ближайшее время Microsoft планирует перенести решение на другие базовые модели, в том числе собственные MAI и разработки OpenAI.

Результаты тестов

По данным Microsoft, новинка показала наивысшую точность в сравнении по 36 бенчмаркам. Они включали почти 150 000 вопросов, которые не использовались при обучении.

Столбчатая диаграмма средней точности моделей принятия решений на 36 бенчмарках: Microsoft-Decision-1 — 83,5%, Jev 1.13.0 — 82,3%, Quyet-1.0-Large — 81,9%, Surogate Rune 26B-A4B — 79,7%, GPT-6 Luna Decisions — 79,4%, deck-31B — 77,8%, H2O-Lightning-4B — 77,2%, Strands-Decider 2B — 54,8% (по 23 из 36 бенчмарков)
Средняя точность моделей принятия решений на 36 бенчмарках. Источник: Microsoft.

Модель также стала самой быстрой из протестированных: она в 2,5 раза опередила ближайшего конкурента H2O-Lightning-4B v1.1 и в 35 раз — GPT-6 Sol.

Столбчатая диаграмма медианной задержки моделей на один запрос: Microsoft-Decision-1 — 85 мс, H2O-Lightning-4B v1.1 — 210 мс, Jev 1.13.0 — 240 мс, GPT-6 Luna Decisions — 300 мс, Quyet-1.0-Large и Surogate Rune 26B-A4B — по 380 мс, deck-31B — 400 мс, GPT-6 Sol — 3,01 с
Медианная задержка на один запрос в наборе тестов JevBench. Источник: Microsoft.

Компания отдельно проверила устойчивость модели. Один и тот же запрос изменяли восемью способами, в частности перефразировали инструкции, переставляли варианты ответа и добавляли шум в форматирование. В среднем решение менялось в 1,3% случаев. Перефразирование описаний вариантов и их перестановка на результат не повлияли.

В тестах безопасности разработчики использовали 5250 запросов из 11 бенчмарков: вредоносных, попыток джейлбрейка и промпт-инъекций. Как утверждает Microsoft, модель отклоняла вредоносные действия и при этом сохраняла полезность.

Внутреннее применение

Подразделение Xbox Research с помощью Microsoft-Decision-1 разметило более 10 000 отзывов из опросов, Steam и X. По качеству модель была сопоставима с GPT-6 Sol, но работала более чем в 14 раз быстрее и обошлась в 200 раз дешевле.

Команда Copilot применила нейросеть для оценки качества ответов чат-бота и агентов. Результаты не уступали GPT-5.6 Luna при стократном росте скорости.

В Microsoft Discovery модель выставляла оценки экспериментам для адаптивного перепланирования. Они получились в 46 раз стабильнее, чем у LLM, при втрое большей скорости. Само перепланирование ускорилось почти вчетверо.

Среди других сценариев компания назвала выбор подходящей модели под запрос, модерацию контента, проверку кода, управление интерфейсами и робототехнику.

Стоимость использования составляет $0,042 за миллион входных токенов. Выходные токены бесплатны.

Напомним, в конце сентября Microsoft представила новую версию Copilot, которая объединит чат, инструменты для создания приложений и автоматизаций, а также автономных ИИ-агентов.

Подписывайтесь на ForkLog в социальных сетях

Telegram (основной канал) Facebook X
Нашли ошибку в тексте? Выделите ее и нажмите CTRL+ENTER

Мы используем файлы cookie для улучшения качества работы.

Пользуясь сайтом, вы соглашаетесь с Политикой приватности.

OK