Журнал действий ИИ-агента: что записывать, чтобы можно было отменить ошибку
Журнал агента нужен не ради отчётности. Он показывает, откуда взялся вывод, какой инструмент был вызван, что подтвердил человек и можно ли откатить действие. Минимальная запись содержит время, версию модели, вход, план, разрешённый инструмент, внешний шаг и решение оператора.
Не храните в журнале секреты и лишние персональные данные. Важнее сохранить ссылку на источник, причину остановки и итог проверки. Через несколько запусков журнал покажет повторяющиеся причины ошибок: неясная инструкция, старые данные или слишком широкий доступ.
Вопросы и ответы
Кто читает журнал?
Владелец сценария и сотрудник, который отвечает за внешний результат. Доступ к нему также ограничивают по ролям.
Запись, которой достаточно для разбора
Вместо сплошного потока технических событий сделайте одну понятную запись на каждый маршрут. В ней нужны: идентификатор теста, время начала и конца, версия модели и сценария, обезличенный вход, план агента, список вызванных инструментов, результат каждого шага и решение человека. Для критичного действия добавьте ссылку на исходный объект или скрин тестового экрана, но не копируйте в журнал секреты и персональные данные.
Такой формат позволяет ответить на полезные вопросы: агент неверно понял инструкцию, увидел устаревшие данные или ему дали слишком широкое право? Без этого три разные причины превращаются в одинаковое «модель ошиблась», и команда не может улучшить процесс.
Как журнал помогает не повторять ошибку
Раз в неделю группируйте записи по причине остановки. Если повторяется «не найден элемент», проверьте стабильность интерфейса и критерии поиска. Если часто не хватает данных, пересмотрите входной шаблон. Если оператор постоянно отменяет один и тот же внешний шаг, он должен стать обязательной точкой подтверждения. Важна не красота отчёта, а изменение следующего запуска.
Журнал также показывает честную стоимость сценария: сколько времени заняла подготовка, сколько — проверка, сколько — исправления. Его данные пригодятся при сравнении экранного маршрута и API, когда команда решает, нужно ли развивать автоматизацию.