Практика: контрольный набор для новой ИИ-модели за один рабочий день
Контрольный набор не требует лаборатории. Это шесть–десять обезличенных примеров, которые отражают реальную работу: обычная задача, неполный ввод, конфликт фактов, длинный документ, нежелательное внешнее действие и запрос на уточнение. Главное — записать ожидаемое поведение до запуска, иначе новая модель всегда будет казаться лучше просто потому, что отвечает иначе.
Для каждого примера укажите исходные данные, допустимый результат, критические ошибки и того, кто проверяет. Не оценивайте только гладкость текста. Смотрите, показала ли модель источник, задала ли вопрос при нехватке данных, не придумала ли факт и не выдала ли обещание от имени компании. Внешнее действие оставьте выключенным.
Сравните новую версию с текущим маршрутом в одинаковых условиях. Запишите время до проверенного ответа, число исправлений и стоимость запуска. Если преимущество видно только на одном красивом примере, это ещё не повод менять процесс. Если оно повторяется, расширяйте набор постепенно. Журнал ИИ-задач помогает не потерять решения между проверками.
Самая полезная строка в наборе — «когда модель должна остановиться». Она показывает не слабость системы, а зрелость процесса. Если вход неполный, лучше получить вопрос, чем уверенный, но вымышленный итог.
FAQ
Можно ли взять примеры из интернета? Для интерфейса — да, для решения о внедрении нужны свои обезличенные кейсы. Сколько примеров достаточно? Начните с шести. Нужно ли публиковать результаты? Нет, это внутренний инструмент проверки.