Игорь Градов
Игорь Градов
6 мин
ai

Microsoft AI модели пополнились Decision-1: оценка вариантов за 85 мс в 200 раз дешевле GPT

Microsoft второго июня открыла доступ к Microsoft-Decision-1, модели нового типа, которая не генерирует текст, а оценивает варианты ответа и возвращает вероятность каждого, что позволяет автоматизировать классификацию и контроль качества за доли секунды.

Почему это важно

Microsoft выделяет «модели решений» (decision models) в отдельную категорию Microsoft AI моделей: вместо длинного текстового ответа программа получает число, вероятность правильного варианта, и действует мгновенно, без разбора прозы.

До сих пор для задач вроде модерации отзывов, проверки качества ответов ИИ или маршрутизации запросов приходилось использовать большие языковые модели общего назначения. Они дороги, медленны и часто выдают «галлюцинации» (уверенные выдумки вместо фактов). Microsoft-Decision-1, по данным Marktechpost, предлагает альтернативу: узкоспециализированная модель, которая только оценивает заданные варианты и отдаёт калиброванную вероятность в формате JSON.

Что Когда Кто выпустил Цена
Microsoft-Decision-1, модель для классификации, маршрутизации и контроля качества Доступна сейчас (июнь 2025) Microsoft $0,042 за миллион входных токенов, выходные токены бесплатны

Что умеет Microsoft-Decision-1?

  • Оценивает закрытый набор вариантов. Модель не пишет текст. Она принимает ситуацию, вопрос и фиксированные варианты ответа, а возвращает вероятность для каждого за один вызов.
  • Поддерживает типовые задачи классификации. Формат «да/нет», множественный выбор, рейтинг, рубрика, оценка ответов ИИ и предлагаемых действий ИИ-агентов (программ, которые выполняют задачи самостоятельно), проверка обоснованности по предоставленным данным, явный вариант «невозможно определить».
  • Работает быстро. По данным Microsoft, медианная задержка (p50) составляет 85 миллисекунд, а задержка на 95-м перцентиле (то есть для 95 из 100 запросов) составляет 125 мс.
  • Лидирует во внутреннем сравнении Microsoft. Средняя точность 83,5% на 36 бенчмарках (тестовых наборах) из 147 137 вопросов. Для сравнения: ближайший конкурент Quyet-1.0-Large показал 81,9%.
  • Устойчива к перефразированию. Microsoft проверяла модель восемью типами возмущений (перефразирование, перетасовка вариантов). Модель меняла решение в среднем в 1,3% случаев. При перефразировании или перестановке вариантов переключений не было вовсе.

На чём построена модель?

Microsoft-Decision-1 дообучена (fine-tuning, обучение на специальных данных под узкую задачу) на базе Qwen3.5-9B от Alibaba. Контекстное окно (объём текста, который модель «видит» за один раз) составляет 32 768 токенов (токен, это примерно одно слово или его часть).

Обучающие данные собраны из открытых наборов по процедуре Microsoft Open Data плюс синтетические данные. Весов модели в открытом доступе нет, квантованных (сжатых) вариантов тоже нет. Microsoft сообщает, что планирует перевести будущие версии на собственные модели MAI и модели OpenAI.

Где подвох с бенчмарками?

Все 36 бенчмарков проведены самой Microsoft, независимых замеров пока нет. Компания H2O.ai оспаривает методику сравнения задержки: по её данным, формат JevBench удваивает реальное время и добавляет 0,15 секунды, а реальная медиана задержки её модели H2O-Lightning-4B составляет 29 мс, а не 210 мс, как показано в таблице Microsoft. При этом Microsoft-Decision-1 на доске JevBench пока не появилась. Факт характерный: пока единственный источник цифр о производительности модели сам разработчик.

Внутренние кейсы Microsoft

По данным компании, Xbox Research отсортировал более 10 000 отзывов в 14 раз быстрее и в 200 раз дешевле, чем с помощью GPT-6 Sol. В контроле качества Copilot модель сопоставима по точности с GPT5.6 Luna и в 100 раз быстрее. Microsoft Discovery получила результаты в 46 раз стабильнее, чем при скоринге обычной языковой моделью, и в 3 раза быстрее.

Чего модель не умеет?

Microsoft прямо перечисляет ограничения в карточке модели:

  • Не генерирует текст, не ведёт диалог, не переводит, не пишет резюме.
  • Работает только с текстом: ни картинок, ни аудио, ни видео.
  • Не объясняет своих решений, не выдаёт обоснования.
  • Запрещена для автоматических решений о кредитах, найме, жилье, здоровье или правах без участия человека.

Как попробовать?

  1. Откройте Microsoft Foundry, модель доступна как «Direct from Azure» (напрямую через облако Azure).
  2. Альтернативный путь: OpenRouter, но через Decisions API, а не стандартный чат-эндпойнт. Обычные SDK для чат-диалогов не подойдут.
  3. Сформируйте запрос: ситуация, вопрос и фиксированные варианты ответа. На выходе получите JSON с вероятностью каждого варианта.
  4. Учитывайте цену: $0,042 за миллион входных токенов, выходные бесплатны. Для сравнения: аналогичный эндпойнт OpenAI Luna для решений стоит $0,10 за миллион входных токенов.

Есть ли аналог в России?

Прямого аналога среди российских Microsoft AI моделей такого типа пока нет. YandexGPT и GigaChat от Сбера решают задачи классификации, но как языковые модели общего назначения: они генерируют текст и стоят дороже на массовых задачах с закрытым набором вариантов. Для модерации отзывов на Дзене или проверки качества ответов ИИ-ассистента российскому бизнесу по-прежнему приходится использовать полноценную генеративную модель. О технической основе и возможности вызова Decision-1 из России Microsoft не сообщила.

Что делать с этим прямо сейчас, по ролям?

Автору Дзена. Если вы используете ИИ для генерации черновиков, Decision-1 может проверять каждый абзац на соответствие фактам из источника (groundedness check): подаёте текст и источник, получаете «обоснован / не обоснован» с вероятностью. Это дешевле и быстрее, чем просить вторую языковую модель перечитать весь текст.

Маркетологу. Классификация тысяч отзывов, тикетов, комментариев по категориям за $0,042 за миллион токенов меняет экономику: раньше это стоило в десятки раз больше на моделях общего назначения. Модель не объясняет причину, значит, для задач с обоснованием (ответ клиенту) нужен второй слой.

Предпринимателю РФ. Доступ через Azure и OpenRouter, оба работают по API. Убедитесь, что ваш аккаунт Azure не ограничен по региону, и протестируйте на небольшой выборке, прежде чем переносить конвейер.

Мнение редакции dzen.guru

По моим наблюдениям, большинство задач, где бизнес использует GPT-4 или Claude, это именно классификация и проверка: «подходит / не подходит», «положительный / отрицательный / нейтральный», «обоснован фактами или выдумка». Для них генеративная модель избыточна, как нанимать переводчика-синхрониста, чтобы он отвечал «да» или «нет». Microsoft-Decision-1 делает ровно это: отвечает «да» или «нет» с вероятностью, за 85 мс и почти бесплатно. Оговорка: все бенчмарки пока от самого вендора, а веса закрыты. Пока независимые тесты не подтвердят цифры, я бы использовал модель для некритичных задач (сортировка отзывов, предварительная модерация) и сравнивал результат с тем, что даёт ваша текущая модель на тех же данных. Первый шаг: возьмите 100 реальных примеров из вашей задачи, прогоните через Foundry API и сравните точность с текущим решением.

Частые вопросы

Decision-1 заменяет ChatGPT или Claude?

Нет. Модель не генерирует текст, не ведёт диалог, не пишет статьи и не переводит. Она только оценивает заданные варианты. Для задач, где нужен развёрнутый ответ, по-прежнему нужна генеративная модель.

Можно ли запустить модель на своём сервере?

Нет. Microsoft не опубликовала веса, сжатых вариантов нет. Модель доступна только через API Microsoft Foundry и OpenRouter (на инфраструктуре Azure). Характеристики оборудования не раскрыты.

Безопасна ли модель для автоматической модерации?

Microsoft провела тесты безопасности: 5 250 запросов по 11 бенчмаркам, включая вредоносный контент, джейлбрейки (попытки обойти ограничения) и внедрение промптов. Компания сообщает о корректных отказах с сохранением полезности, но конкретных баллов не публикует. Для задач, затрагивающих права людей (найм, кредиты, здоровье), модель запрещено использовать без участия человека, это прямое требование карточки модели.

Если ваш конвейер сейчас тратит доллары на то, чтобы большая модель отвечала «да» или «нет», протестируйте Decision-1 на сотне реальных примеров и посчитайте, сколько вы переплачивали за генерацию текста, который никто не читал.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Что такое ИИ-агент и почему он опаснее чат-бота: утечки, слежка, доступ к картам

Почему это важно Каждый крупный разработчик ИИ-агентов обещает «новый стандарт приватности», но на практике ни один пока не доказал, что данные пользователей в…

6 мин
Студент МФТИ выиграл соревнование FLARE по медицинскому ИИ: опухоль на КТ за 11 секунд
ai

Студент МФТИ выиграл соревнование FLARE по медицинскому ИИ: опухоль на КТ за 11 секунд

Студенческая команда из России выиграла международное соревнование FLARE 2026 по медицинскому ИИ, обойдя конкурентов со всего мира моделью PANTHER, которая…

6 мин
Qwen модели обошли GPT в SQL-бенчмарке: в 17 раз дешевле и работают на ноутбуке
ai

Qwen модели обошли GPT в SQL-бенчмарке: в 17 раз дешевле и работают на ноутбуке

Qwen 3.8 27B, модель с открытыми весами (open weights) от Alibaba, в агентном SQL-бенчмарке DABstep обошла GPT 5.6 Luna Max от OpenAI при стоимости запуска…

5 мин