Как выпускать обновления агента поддержки и вовремя замечать ухудшение
Новая версия агента хорошо отвечает на знакомые вопросы, но ошибается в редком возврате. Если проверять только несколько удачных диалогов, проблема проявится уже у клиентов. Нужен понятный порядок допуска изменений в работу.

Databricks в публикации от 9 сентября описывает подход Zepto: контур разработки связан с рабочим контуром через проверку качества. Ошибки из эксплуатации пополняют контрольные данные, а новую версию сравнивают с действующей. В разборе используются MLflow, трассировка действий и несколько способов оценки.
Согласуйте требования с владельцами процесса
Служба поддержки определяет корректность решения, операционная команда — допустимую задержку, а владелец процесса — разрешённые действия и условия передачи человеку. Эти требования превращаются в контрольные ситуации.
Для пилота выберите одну категорию, например вопросы о статусе доставки. В подборке должны быть обычный заказ, задержка, отсутствие данных, повторное обращение и просьба выполнить действие за пределами полномочий агента.
Сравнивайте версии до выпуска

Зафиксируйте текущую версию и ожидаемые результаты. Изменение текста инструкции, модели или инструмента проверяйте на одной и той же подборке. Отдельно отмечайте, какие ситуации стали лучше, какие хуже и почему.
После выпуска продолжайте выборочную проверку живых обращений. Редкие и рискованные ситуации следует рассматривать отдельно: средний показатель может скрыть проблемы в небольшой категории. Подтверждённый сбой становится новым контрольным примером.
Для оценки разговорной части используйте критерии из материала о контроле качества клиентских диалогов, дополнив их проверкой действий в рабочих системах.
Риски пилота и условия масштабирования

Подборка только из простых вопросов создаёт завышенную оценку готовности. Включайте исключения и обновляйте набор по реальным сбоям. Критерий готовности — проверены все выбранные категории и заранее согласованы допустимые результаты.
Модель-оценщик может считать уверенную формулировку правильной. Сверяйте её с человеческой разметкой и проверяйте статусы, номера и операции по данным систем. Критические ошибки должны иметь отдельное правило остановки.
Заранее подготовьте возврат к прежней версии и назначьте ответственного. В отчёте руководителю показывайте подтверждённые решения, передачи человеку, повторные обращения и затраты на обработку. Положительный результат в одном классе обращений даёт основание расширять пилот постепенно.
Видео: Мониторинг сбоев и проверка результата
Игорь Зуевич показывает подходы к мониторингу ошибок, проверке интеграций и результата работы агента. Найденные сбои можно добавлять в контрольный набор перед следующим обновлением.
