Метрики чат-бота: что измерять и что игнорировать
Большинство дашбордов чат-бота ставит наверх количество диалогов. Эта цифра растёт, если сделать виджет назойливее, поэтому оптимизировать её контрпродуктивно. Эта статья отделяет цифры, которые говорят что-то о бизнесе, от тех, что просто измеряют активность, — и даёт формулу для каждой. Поддержка и продажи разобраны отдельно, потому что их определения успеха противоположны, приведены три цифры, применимые к любому каналу, и прямо названы ловушки измерения: подсчёт тестовых диалогов, среднее вместо медианы и отсутствие разбивки по языкам.
Метрики тщеславия против бизнес-метрик
Метрику можно проверить одним вопросом: можно ли улучшить эту цифру искусственно и улучшается ли при этом бизнес? Если ответ «да, нет» — это метрика тщеславия.
Количество диалогов — классический пример. Сделайте виджет открывающимся на каждой странице, и цифра удвоится, а продажи не изменятся. Время ответа тоже может быть ловушкой: бот отвечает за секунду, поэтому среднее всегда отличное и не говорит ни о чём.
У полезных цифр есть общее свойство: единственный способ их улучшить — действительно делать работу лучше. Список ниже построен по этому тесту.
Цифры, которые пора перестать показывать
- Общее количество диалогов — измеряет трафик и назойливость виджета, а не ценность.
- Среднее время ответа, где бот и человек считаются вместе, — реплики бота прячут человеческую очередь, и двухчасовое ожидание выглядит как десять секунд.
- Количество отправленных сообщений — чем хуже идёт разговор, тем больше эта цифра.
- Доля решений без человека без проверки качества — бот, доводящий людей до ухода, выглядит здесь отлично.
- Собственная оценка уверенности бота — полезна для отладки модели, в бизнес-отчёте ей места нет.
- Оценка тональности, если на её основе не принимается ни одно решение.
Метрики для сценария поддержки
- Доля полного решенияФормула: диалоги, закрытые без участия человека и не переоткрытые клиентом в течение 24 часов, делённые на все диалоги. Условие о переоткрытии обязательно — без него цифра измеряет уход.
- Доля эскалаций по причинамФормула: диалоги, дошедшие до оператора, делённые на все диалоги, в разбивке по триггерам. Общая цифра не говорит ничего; рост доли пробелов в знаниях означает, что нужен материал.
- Время от эскалации до первого ответа человекаФормула: медиана между уведомлением оператору и его первым сообщением. Берите медиану, а не среднее: один длинный случай искажает среднее.
- Доля повторных обращенийФормула: случаи, когда тот же клиент пишет по той же теме второй раз в течение семи дней, делённые на решённые диалоги. Это единственная цифра, показывающая, означало ли «решено» решение.
- Сэкономленные часы операторовФормула: диалоги, решённые без человека, умноженные на среднее время оператора на один ответ. Отчётность Vexvon считает это исходя примерно из трёх минут на ответ — методологию нужно называть, иначе цифра является маркетингом, а не доказательством.
Метрики для сценария продаж
- Доля конверсии в лидФормула: диалоги, породившие маршрутизированный лид, делённые на все диалоги. Правильного значения нет — зависит от структуры трафика, — но резкое изменение всегда стоит разобрать.
- ДостижимостьФормула: лиды, до которых продажи реально дозвонились, делённые на квалифицированные лиды. Вскрывает сценарий, собирающий номера, на звонок по которым никто не соглашался.
- Принятие продажамиФормула: лиды, которые продажи сочли стоящими звонка, делённые на лиды, до которых дозвонились. Единственная настоящая мера качества квалификации, требующая, чтобы продажи фиксировали вердикт.
- Время до первого контактаФормула: медиана от конца разговора до первой попытки связаться. Эта цифра часто важнее качества квалификации.
- Конверсия по пути приходаФормула: закрытые сделки, делённые на лиды, отдельно для пришедших через бота и остальных. Именно эта цифра закрывает спор о том, не стоит ли вам автоматизация сделок.
Три цифры, применимые везде
- Доля диалогов, приходящих вне рабочих часов. Обычно выше, чем ожидают команды, и самое ясное обоснование автоматизации.
- Распределение по часам. Единственная цифра, показывающая, совпадает ли ваш график со спросом.
- Разбивка по каналам. Сама по себе она решает, сколько вкладывать в какой канал.
- Стоимость ИИ на диалог. Счёт за ИИ, который нельзя разложить, — ежемесячный сюрприз; разложенный по диалогам он становится управляемой статьёй.
Ловушки измерения
- Считать тестовые диалоги. Одна неделя тестирования полностью искажает месяц — их следует исключать по умолчанию.
- Использовать среднее вместо медианы. У длительностей и времён ответа всегда длинный хвост, и среднее его прячет.
- Считать реплики бота и человека вместе — это каждый раз прячет человеческую очередь.
- Не разбивать по языкам. Язык, работающий плохо, обычно самый малый по объёму и в общей цифре невидим.
- Читать только успешные разговоры. Метрики говорят, что проблема есть; брошенные расшифровки говорят, где именно.
- Превращать цифру в показатель эффективности команды — это превращает её из того, чем пользуются, в то, чем манипулируют.
Что измеряет Vexvon
Отчётность выгружается в Excel и охватывает общий обзор, анализ рабочих часов с почасовой тепловой картой, разбивку по каналам и аналитику лидов. Раздел «три общие цифры» выше берётся напрямую из этого отчёта — почасовое распределение и поступление вне рабочих часов показаны отдельно.
Диалоги, закрытые без человека, и созданные лиды измеряются отдельно, так что метрики поддержки и продаж не смешиваются. Сэкономленные часы операторов считаются с открыто названной методологией: примерно три минуты на ответ. Тестовые диалоги исключаются из цифр по умолчанию.
Стоимость ИИ и токены логируются по семнадцати назначениям с указанием модели и канала, а по каждому звонку фиксируются токены, задержка, доля успеха и стоимость в долларах — именно это делает метрику «стоимость ИИ на диалог» возможной, а не желаемой.
Со стороны лидов карточка несёт статус, этап, приоритет, причину закрытия и счётчик попыток контакта, а каждое изменение пишется в журнал активности с десятью типами действий — там и живёт поле вердикта, которого требуют принятие продажами и достижимость. Диалоги и пары вопрос-ответ выгружаются в Excel.
Частые вопросы
- Какая одна метрика лучше всего показывает работу чат-бота?Одной такой нет. Для поддержки ближе всего доля полного решения вместе с проверкой качества, для продаж — принятие продажами. Количество диалогов не заменяет ни ту, ни другую.
- Хорошая ли метрика доля решений без человека?Только вместе с проверкой качества. Сама по себе она награждает бота, доводящего людей до ухода, потому что уход тоже выглядит как диалог, закрытый без человека.
- Почему медиана, а не среднее?У длительностей и времён ответа длинные хвосты. Несколько очень долгих случаев тянут среднее, а медиана описывает то, что пережил типичный клиент.
- Можно ли объединять метрики поддержки и продаж?Нет. Их определения успеха противоположны: в поддержке хорошо, когда разговор не дошёл до человека; в продажах нужный лид, не дошедший до человека, — потеря.
- Как измерять стоимость ИИ?По диалогам и в разбивке по назначениям. Нерасчленённой месячной цифрой нельзя управлять — ей можно только удивляться.
- Как часто пересматривать метрики?Цифры — ежемесячно, сам набор метрик — ежеквартально. Команды оптимизируют то, что измеряется, поэтому выбор измеряемого сам по себе является решением.
Начните с одной метрики
Не начинайте с проектирования всего дашборда. Выберите одну цифру — долю повторных обращений для поддержки, принятие продажами для продаж — и честно измеряйте её месяц. Эта одна цифра почти всегда показывает, каким должно быть следующее изменение, тогда как дашборд из двенадцати цифр обычно не показывает ничего.