Skip to main content
Поддержка и база знаний

Аудит качества ответов чат-бота: оценка живых диалогов

Чат-бот тестируют перед запуском, а потом на его ответы никто не смотрит — пока клиент не пришлёт скриншот со старой ценой. Аудит после запуска — другой процесс: он проверяет на реальных диалогах, что бот по-прежнему работает правильно. В материале — рубрика из пяти измерений для аудита качества ответов чат-бота, случайная и рискованная выборки, простая шкала баллов, поиск источника ошибки, список исправлений, ритм аудита, плотная проверка тем высокого риска и пример недельного аудита.

28 сентября 20266 мин чтения

Бот работает. Хороши ли его ответы?

Чат-бот тестируют перед запуском, он выходит в работу, и через какое-то время команда перестаёт смотреть на его ответы. В отчёте растёт число диалогов и падает число передач — всё выглядит хорошо. А потом клиент присылает скриншот со старой ценой, и выясняется, что бот называет её уже две недели.

Тест перед запуском показывает, готов ли бот. Аудит после запуска показывает, работает ли он по-прежнему правильно, и это другой процесс. В материале — рамка аудита качества ответов чат-бота: рубрика оценки, выборка, шкала баллов, превращение находок в список исправлений и ритм аудита.

Чем аудит отличается от теста перед запуском

  1. Тест перед запускомПроводится по сценариям, подготовленным командой. Вопрос: правильно ли бот отвечает на ожидаемые вопросы?
  2. Аудит после запускаПроводится по выборке реальных диалогов с клиентами. Вопрос: как бот справляется с реальными неожиданными вопросами, не устарели ли материалы, подходит ли тон, работает ли эскалация?

Семейства сценариев для теста перед запуском — в чек-листе тестирования чат-бота. У аудита другой источник — сообщения, которые клиенты пишут на самом деле.

Рубрика QA: пять измерений

Каждый ответ оценивается по пяти измерениям. Их держат раздельно, потому что каждое исправляется в своём месте.

  1. ТочностьФактически ли верен ответ и соответствует ли утверждённым материалам? Неверная цена, старое правило, выдуманная деталь — самая тяжёлая ошибка.
  2. ПолнотаПолностью ли отвечен вопрос клиента? Если на один из двух вопросов нет ответа, ответ неполный.
  3. ЭскалацияПередан ли человеку случай, который требовал передачи? Лишняя передача — тоже ошибка: бот не ответил на то, что должен знать.
  4. ТонСоответствует ли ответ согласованному тону бренда? Холодность к недовольному клиенту, длинный ответ на простой вопрос — ошибки тона.
  5. РезультатЗакончился ли диалог результатом для клиента — ответом, следующим шагом, передачей? Или клиент просто ушёл?

Выборка

Прочитать все диалоги невозможно. Выборку нужно строить так, чтобы проблемы были видны.

  • Случайная выборка — 30–50 диалогов в неделю, показывает общий уровень
  • Рискованная выборка — негативный настрой, длинные диалоги, повторяющийся вопрос
  • Переданные оператору диалоги — показывают, почему бот остановился
  • Диалоги по новой теме или в период кампании — там материалы устаревают чаще всего
  • Доля из каждого канала — в Instagram, WhatsApp и на сайте бот может вести себя по-разному

Шкала баллов

Простая шкала делает аудиты сопоставимыми. На каждое измерение хватает трёх уровней:

  1. 2 — хорошоИзмерение выполнено полностью.
  2. 1 — приемлемоНебольшой недочёт без вреда для клиента: ответ длинноват, не хватает одной детали.
  3. 0 — ошибкаНеверный факт, пропущенная эскалация, ответ, который путает или раздражает клиента.

Каждый ответ с 0 по точности помечается отдельно и исправляется на этой же неделе, независимо от среднего. Среднее — для динамики, единичный ошибочный ответ — для немедленного действия.

Как найти источник ошибочного ответа

Когда найден ошибочный ответ, главный вопрос — почему? Есть четыре типичных источника:

  • Устаревшие материалы — старая цена или правило в базе знаний
  • Противоречивые материалы — два документа говорят разное
  • Поиск нашёл не тот фрагмент — материал верный, но бот взял его из другой темы
  • Нет правила — что делать боту в этом случае, не записано

В Vexvon в каждом ответе видно, какой фрагмент знаний использован. Это сокращает поиск источника ошибки до минут: фрагмент устарел — дело в материалах; фрагмент верный, но не подходит — проблема поиска.

Список улучшений

Результат аудита — не отчёт, а список работ. Каждая находка — одна строка:

  • Что найдено — краткое описание диалога
  • Какое измерение — точность, полнота, эскалация, тон, результат
  • Источник — материалы, противоречие, поиск, правило
  • Исправление — конкретное действие
  • Владелец и срок
  • Проверка — повторилась ли та же ошибка на следующем аудите

Исправления, связанные с материалами, уходят в базу знаний; как проверяются сами материалы, разобрано в статье об аудите базы знаний чат-бота.

Ритм аудита

  1. Еженедельно30–50 диалогов, один человек, один час. Ошибки точности исправляются на той же неделе.
  2. ЕжемесячноДинамика: средний балл по пяти измерениям, самый частый источник ошибок, состояние списка.
  3. По событиюНовая кампания, изменение цен, новый продукт — отдельный небольшой аудит в первые три дня.

Пример: недельный аудит

  1. Выборка40 случайных и 10 рискованных диалогов.
  2. НаходкиДва 0 по точности: старая стоимость доставки. Один 0 по эскалации: клиент, написавший «верните деньги», не был передан. Пять 1 по тону: ответы излишне длинные.
  3. ИсправленияСтоимость доставки обновлена в базе знаний; фразы о возврате денег добавлены в правило эскалации; настройка длины ответа переведена на короткую.
  4. Следующая неделяПроверяется, повторились ли те же ошибки.

Плотная проверка для тем высокого риска

В некоторых темах один ошибочный ответ обходится дороже десятков хороших. Для них случайной выборки недостаточно.

  • Список: цены и скидки, юридические условия, здоровье, финансы, безопасность
  • Все диалоги по этим темам — или хотя бы несколько каждый день — читаются
  • В аудите участвует владелец темы: цены проверяет руководитель продаж, условия — юрист
  • После каждого изменения — новой цены, нового правила — первые 24 часа проверяются отдельно

Чек-лист аудитора

  • Каждый ли факт в ответе есть в утверждённых материалах?
  • Отвечены ли все вопросы клиента?
  • Было ли слово или ситуация, требующие передачи, и был ли диалог передан?
  • Соответствует ли тон настроению клиента?
  • Закончился ли диалог результатом?
  • Если есть ошибка — какой фрагмент знаний был использован?

Что измерять

  • Средний балл по пяти измерениям — недельная динамика
  • Число ошибок точности — цель близка к нулю
  • Пропущенные эскалации
  • Открытые исправления в списке и их возраст
  • Повтор той же ошибки — исправление не сработало

Выгрузка вопросов и ответов и доля настроений есть в отчёте аналитики — оттуда удобно брать рискованную выборку.

Ограничения

Аудит проводится по выборке и находит не все ошибки. Редкие, но дорогие ошибки — например, неверный ответ на медицинский или юридический вопрос — могут не попасть в случайную выборку, поэтому для тем высокого риска нужна отдельная, более плотная проверка. Аудитор должен знать предметную область — тот, кто не знает продукт, не заметит неверную цену.

Итог: качеством управляют и после запуска

Аудит качества ответов чат-бота — не разовый тест, а еженедельная привычка. Рубрика из пяти измерений, случайная и рискованная выборки, простая шкала, поиск источника ошибки и список исправлений — при этих условиях бот со временем не деградирует, а становится немного лучше каждую неделю.

Диагностика повторяющихся вопросов — в статье о повторяющихся вопросах; остальные материалы о поддержке — в этой рубрике. Чтобы вместе выстроить процесс аудита, свяжитесь с нами.

Частые вопросы

  1. Кто должен проводить аудит качества ответов?Тот, кто знает продукт и правила, — обычно руководитель поддержки или владелец знаний. Внешний аудитор может не заметить неверную цену или старое правило.
  2. Сколько диалогов в неделю достаточно?Обычно 30–50 случайных и 10–20 рискованных. При большом объёме выборку делят по каналам.
  3. Можно ли автоматизировать аудит?Отбор рискованных диалогов — да. Оценку полностью — нет, нужен человек, который знает, что верно.
Live demo

Ready? Let's start

See Vexvon live in a 10-minute demo.

  • A scenario built for your business
  • A live sample call
  • A tour of the platform
Get a demoorBook a meeting

Your details are used only for the demo and to get in touch.