ИИ ИИшка Про
Новости
Microsoft

Microsoft-Decision-1: модель выбирает вариант, а не сочиняет ответ

Редакция ИИШКА Про
Иллюстрация к материалу: Microsoft-Decision-1: модель выбирает вариант, а не сочиняет ответ

9 октября Microsoft представила Decision-1 — модель не для переписки, а для выбора из заранее заданных вариантов. Ей можно передать обращение клиента и варианты «оплата», «доставка», «возврат», а получить оценку вероятности для каждого. Такая постановка выглядит скромнее универсального чата, но именно она встречается в рабочих процессах десятки раз подряд. Когда программа ожидает одну метку, длинное объяснение модели приходится разбирать и проверять; структурированный ответ экономит этот этап. При этом оценка вероятности не превращает ошибочное решение в безопасное. Система должна знать, когда передавать случай человеку.

Что выпущено и что проверено

По описанию разработчика, Decision-1 построена на Qwen3.5-9B с дополнительным обучением для однопроходной оценки решений. Она принимает фиксированный набор ответов и выдаёт вероятность каждого. Поддерживаются бинарный выбор, несколько классов, оценка по шкале и проверка ответа по рубрике. Модель доступна в Microsoft Foundry; разработчик также указывает сторонний маршрут через OpenRouter. Это сервисная модель, а не обещание свободно скачать веса и запустить их офлайн. В карточке Decision-1 собраны характеристики, а ниже — последствия нового формата для реальной задачи.

Microsoft сообщает о сравнении на 36 наборах почти из 150 тысяч вопросов и о преимуществе по скорости над выбранными конкурентами. Эти числа относятся к исследованию самой компании. Нам не известен независимый тест на русскоязычных обращениях, на неоднозначных юридических документах или на данных конкретной службы поддержки. Поэтому формулировка «быстрее на опубликованном наборе» честнее, чем «лучше любого ИИ для бизнеса». Цена входа, заявленная в описании, составляет 0,042 доллара за миллион входных токенов, выходные токены в этой схеме отдельно не тарифицируются. Перед расчётом бюджета нужно проверить действующий тариф и доступность региона.

Почему обычный чат решает эту задачу иначе

Генеративной модели можно написать: «прочитай письмо и назови категорию». Она способна выдать метку, пояснение или неожиданную третью категорию, которой нет в программе. Решение-модель начинает с другого договора: допустимые варианты заданы до вызова, и программа получает числа, пригодные для правила маршрутизации. Если категории плохо продуманы, даже идеально соблюдённый формат не исправит классификацию. Письмо «товар оплачен, но доставлен повреждённым» одновременно касается платежа, доставки и претензии. Следовательно, до подключения модели редактор процесса должен решить, возможны ли несколько меток и кто владеет спорными случаями.

Полезный пример — очередь поддержки интернет-магазина. Возьмём 300 обращений за неделю, удалим имена и номера заказов и вручную разметим их двумя сотрудниками. Разногласия между людьми сохраняем как отдельную группу, а не прячем в «золотом» ответе. Потом сравниваем модель с простым поиском по ключевым словам и с уже используемой чат-моделью. Нас интересуют не только средняя точность и стоимость, но и ложные отправки срочных жалоб в обычную очередь. Смена исполнителя после неверного маршрута может быть дороже экономии на токенах.

Что делать с вероятностью

Вероятность 0,9 на экране — не юридическая уверенность и не универсальный порог. Проверьте калибровку на собственной выборке: из ста случаев с оценкой около 0,9 действительно ли примерно девяносто размечены правильно? Разбейте данные по типам обращений и времени, потому что новый товар или изменение правил возврата меняет распределение. Порог автоматического действия устанавливают исходя из цены ошибки. Например, обычный вопрос о часах работы можно маршрутизировать автоматически, а жалобу о безопасности товара лучше отправлять на проверку независимо от высокой оценки. В разборе проверки агентного действия показано, зачем отдельный путь эскалации.

Если модель используется как судья ответа другой модели, схема сложнее. Судья может предпочесть гладкую формулировку фактически верной, но менее эффектной. Поэтому рубрика должна содержать проверяемые поля: указаны ли условия, не добавлен ли несуществующий срок, признана ли неопределённость. Контрольная группа ручной оценки нужна и после запуска. Microsoft описывает внутренние применения в сортировке отзывов, контроле качества и работе с инцидентами; это примеры разработчика, а не доказательство, что результат перенесётся на ваш язык и набор данных.

Где модель не должна принимать окончательное решение

Не следует автоматически отказывать человеку в услуге, блокировать аккаунт или делать медицинский вывод только потому, что один класс получил максимальный балл. Тут важны право на пересмотр, контекст и объяснимость принятого решения. Даже в менее чувствительной задаче нельзя передавать в сторонний API персональные данные «на всякий случай». Сначала определите минимальный необходимый текст, срок хранения и договорные условия сервиса. Если политика компании требует локального исполнения, доступность модели через облако не решает проблему.

На пилоте достаточно трёх недель: первая — согласование меток и ручная разметка, вторая — теневой прогон без автоматических действий, третья — включение только низкорисковых маршрутов. Логируйте версию категорий, вход без лишних персональных данных, баллы, принятое правило и последующую правку человека. Не подменяйте мониторинг красивой сводной точностью: именно разбивка по дорогим ошибкам показывает, есть ли выигрыш. Для общего устройства таких проверок пригодится практика контрольного набора.

Итог

Decision-1 интересна тем, что переводит часть ИИ-задач из свободного текста в проверяемый выбор. Новость не в том, что машине впервые дали классифицировать письмо, а в специализированном API, вероятностях и заявленном сочетании скорости с ценой. Выбирайте её после собственного теста на ложные маршруты и калибровку; решение о последствиях для человека оставляйте под человеческим контролем.

Частые вопросы

Она заменяет чат-бота? Нет. Чат объясняет, уточняет и пишет; Decision-1 оценивает варианты, которые вы перечислили заранее.

Можно ли сравнить её только по общей точности? Нельзя: отдельно считайте дорогие ошибки и случаи, где сама разметка спорна.

Что означает высокий балл одного варианта? Это оценка модели для данного набора вариантов, а не гарантия правильности и не разрешение на любое действие.

Доступны ли локальные веса? В объявлении описан доступ через сервисы; наличие лицензии на локальный запуск нужно проверять отдельно.

Обложка — иллюстрация редакции о выборе маршрута; она не является снимком интерфейса Microsoft.

Новости Когда ИИ-агент выходит за рамки задачи: четыре случая из проверок Anthropic Anthropic описала четыре действия агентов, которых от них не просили. Разбираем, где проходила граница полномочий и чему этот опыт учит команды с браузерными и файловыми агентами. Новости ICO проверяет защиту данных в ИИ-агентах Британский регулятор сообщил о переменах у десяти разработчиков базовых моделей и начал собирать сведения о рисках автономных агентов. Новости Google представила Gemini agent для рабочих систем: что показали и чего пока не доказали Новый рабочий агент должен связывать документы, почту, код и корпоративные данные. Разбираем объявленные функции и вопросы, которые компании придётся проверить самой. Новости ChatGPT получил Intelligent UI: когда ответ превращается в рабочий интерфейс OpenAI показала ответы с кнопками, графиками и небольшими интерактивными инструментами. Разбираем, что объявлено и какие границы у нового формата.
Опубликовано: 10 октября 18:50
← На главную