Контрольный набор для ИИ-агента: восемь ситуаций, которые нельзя пропустить
Контрольный набор не должен быть огромным. Для первого пилота важнее восемь ситуаций, которые повторяют реальную работу: три нормальных записи, два похожих названия, пустое поле, неожиданное окно и случай, где у агента нет права продолжать. Последний особенно важен: если модель всегда делает вид, что знает ответ, она не готова к внешнему действию.
Каждый пример храните вместе с ожидаемым результатом и причиной. Не «правильно заполнить карточку», а «найти несоответствие в поле срока и передать оператору». Тогда после запуска можно сравнить не впечатление от траектории, а конкретное решение. Скриншоты и входные данные обезличивайте до теста.
Запускайте две версии сценария на одном наборе. Фиксируйте время, попытки, ложные действия и необходимость помощи. Когда один пример меняется, сохраняйте старый: иначе через месяц станет невозможно понять, модель стала лучше или тест стал удобнее. Эта практика дополняет пилот компьютерного агента.
FAQ
Нужно ли включать только ошибки? Нет, нормальные сценарии тоже нужны для базовой линии.
Кто утверждает ожидаемый ответ? Владелец процесса, а не разработчик промпта.