Аудит качества ответов чат-бота: оценка живых диалогов
Чат-бот тестируют перед запуском, а потом на его ответы никто не смотрит — пока клиент не пришлёт скриншот со старой ценой. Аудит после запуска — другой процесс: он проверяет на реальных диалогах, что бот по-прежнему работает правильно. В материале — рубрика из пяти измерений для аудита качества ответов чат-бота, случайная и рискованная выборки, простая шкала баллов, поиск источника ошибки, список исправлений, ритм аудита, плотная проверка тем высокого риска и пример недельного аудита.
Бот работает. Хороши ли его ответы?
Чат-бот тестируют перед запуском, он выходит в работу, и через какое-то время команда перестаёт смотреть на его ответы. В отчёте растёт число диалогов и падает число передач — всё выглядит хорошо. А потом клиент присылает скриншот со старой ценой, и выясняется, что бот называет её уже две недели.
Тест перед запуском показывает, готов ли бот. Аудит после запуска показывает, работает ли он по-прежнему правильно, и это другой процесс. В материале — рамка аудита качества ответов чат-бота: рубрика оценки, выборка, шкала баллов, превращение находок в список исправлений и ритм аудита.
Чем аудит отличается от теста перед запуском
- Тест перед запускомПроводится по сценариям, подготовленным командой. Вопрос: правильно ли бот отвечает на ожидаемые вопросы?
- Аудит после запускаПроводится по выборке реальных диалогов с клиентами. Вопрос: как бот справляется с реальными неожиданными вопросами, не устарели ли материалы, подходит ли тон, работает ли эскалация?
Семейства сценариев для теста перед запуском — в чек-листе тестирования чат-бота. У аудита другой источник — сообщения, которые клиенты пишут на самом деле.
Рубрика QA: пять измерений
Каждый ответ оценивается по пяти измерениям. Их держат раздельно, потому что каждое исправляется в своём месте.
- ТочностьФактически ли верен ответ и соответствует ли утверждённым материалам? Неверная цена, старое правило, выдуманная деталь — самая тяжёлая ошибка.
- ПолнотаПолностью ли отвечен вопрос клиента? Если на один из двух вопросов нет ответа, ответ неполный.
- ЭскалацияПередан ли человеку случай, который требовал передачи? Лишняя передача — тоже ошибка: бот не ответил на то, что должен знать.
- ТонСоответствует ли ответ согласованному тону бренда? Холодность к недовольному клиенту, длинный ответ на простой вопрос — ошибки тона.
- РезультатЗакончился ли диалог результатом для клиента — ответом, следующим шагом, передачей? Или клиент просто ушёл?
Выборка
Прочитать все диалоги невозможно. Выборку нужно строить так, чтобы проблемы были видны.
- Случайная выборка — 30–50 диалогов в неделю, показывает общий уровень
- Рискованная выборка — негативный настрой, длинные диалоги, повторяющийся вопрос
- Переданные оператору диалоги — показывают, почему бот остановился
- Диалоги по новой теме или в период кампании — там материалы устаревают чаще всего
- Доля из каждого канала — в Instagram, WhatsApp и на сайте бот может вести себя по-разному
Шкала баллов
Простая шкала делает аудиты сопоставимыми. На каждое измерение хватает трёх уровней:
- 2 — хорошоИзмерение выполнено полностью.
- 1 — приемлемоНебольшой недочёт без вреда для клиента: ответ длинноват, не хватает одной детали.
- 0 — ошибкаНеверный факт, пропущенная эскалация, ответ, который путает или раздражает клиента.
Каждый ответ с 0 по точности помечается отдельно и исправляется на этой же неделе, независимо от среднего. Среднее — для динамики, единичный ошибочный ответ — для немедленного действия.
Как найти источник ошибочного ответа
Когда найден ошибочный ответ, главный вопрос — почему? Есть четыре типичных источника:
- Устаревшие материалы — старая цена или правило в базе знаний
- Противоречивые материалы — два документа говорят разное
- Поиск нашёл не тот фрагмент — материал верный, но бот взял его из другой темы
- Нет правила — что делать боту в этом случае, не записано
В Vexvon в каждом ответе видно, какой фрагмент знаний использован. Это сокращает поиск источника ошибки до минут: фрагмент устарел — дело в материалах; фрагмент верный, но не подходит — проблема поиска.
Список улучшений
Результат аудита — не отчёт, а список работ. Каждая находка — одна строка:
- Что найдено — краткое описание диалога
- Какое измерение — точность, полнота, эскалация, тон, результат
- Источник — материалы, противоречие, поиск, правило
- Исправление — конкретное действие
- Владелец и срок
- Проверка — повторилась ли та же ошибка на следующем аудите
Исправления, связанные с материалами, уходят в базу знаний; как проверяются сами материалы, разобрано в статье об аудите базы знаний чат-бота.
Ритм аудита
- Еженедельно30–50 диалогов, один человек, один час. Ошибки точности исправляются на той же неделе.
- ЕжемесячноДинамика: средний балл по пяти измерениям, самый частый источник ошибок, состояние списка.
- По событиюНовая кампания, изменение цен, новый продукт — отдельный небольшой аудит в первые три дня.
Пример: недельный аудит
- Выборка40 случайных и 10 рискованных диалогов.
- НаходкиДва 0 по точности: старая стоимость доставки. Один 0 по эскалации: клиент, написавший «верните деньги», не был передан. Пять 1 по тону: ответы излишне длинные.
- ИсправленияСтоимость доставки обновлена в базе знаний; фразы о возврате денег добавлены в правило эскалации; настройка длины ответа переведена на короткую.
- Следующая неделяПроверяется, повторились ли те же ошибки.
Плотная проверка для тем высокого риска
В некоторых темах один ошибочный ответ обходится дороже десятков хороших. Для них случайной выборки недостаточно.
- Список: цены и скидки, юридические условия, здоровье, финансы, безопасность
- Все диалоги по этим темам — или хотя бы несколько каждый день — читаются
- В аудите участвует владелец темы: цены проверяет руководитель продаж, условия — юрист
- После каждого изменения — новой цены, нового правила — первые 24 часа проверяются отдельно
Чек-лист аудитора
- Каждый ли факт в ответе есть в утверждённых материалах?
- Отвечены ли все вопросы клиента?
- Было ли слово или ситуация, требующие передачи, и был ли диалог передан?
- Соответствует ли тон настроению клиента?
- Закончился ли диалог результатом?
- Если есть ошибка — какой фрагмент знаний был использован?
Что измерять
- Средний балл по пяти измерениям — недельная динамика
- Число ошибок точности — цель близка к нулю
- Пропущенные эскалации
- Открытые исправления в списке и их возраст
- Повтор той же ошибки — исправление не сработало
Выгрузка вопросов и ответов и доля настроений есть в отчёте аналитики — оттуда удобно брать рискованную выборку.
Ограничения
Аудит проводится по выборке и находит не все ошибки. Редкие, но дорогие ошибки — например, неверный ответ на медицинский или юридический вопрос — могут не попасть в случайную выборку, поэтому для тем высокого риска нужна отдельная, более плотная проверка. Аудитор должен знать предметную область — тот, кто не знает продукт, не заметит неверную цену.
Итог: качеством управляют и после запуска
Аудит качества ответов чат-бота — не разовый тест, а еженедельная привычка. Рубрика из пяти измерений, случайная и рискованная выборки, простая шкала, поиск источника ошибки и список исправлений — при этих условиях бот со временем не деградирует, а становится немного лучше каждую неделю.
Диагностика повторяющихся вопросов — в статье о повторяющихся вопросах; остальные материалы о поддержке — в этой рубрике. Чтобы вместе выстроить процесс аудита, свяжитесь с нами.
Частые вопросы
- Кто должен проводить аудит качества ответов?Тот, кто знает продукт и правила, — обычно руководитель поддержки или владелец знаний. Внешний аудитор может не заметить неверную цену или старое правило.
- Сколько диалогов в неделю достаточно?Обычно 30–50 случайных и 10–20 рискованных. При большом объёме выборку делят по каналам.
- Можно ли автоматизировать аудит?Отбор рискованных диалогов — да. Оценку полностью — нет, нужен человек, который знает, что верно.