Таксономия аналитики разговоров: как построить правильную систему категорий
Без системы категорий сравнение от месяца к месяцу ломается, и числам нет доверия. В статье — шесть правил таксономии аналитики разговоров, шаги построения, оптимальное число значений, иллюстративный пример и типичные ошибки.
Короткий ответ
Правильная система категорий (таксономия) для аналитики разговоров держится на шести правилах: каждое поле отвечает на один вопрос; значения не пересекаются (взаимоисключают друг друга); у каждого значения есть определение и примеры; «другое» и «неясно» — отдельные значения; технический ключ значения после создания не меняется; каждое изменение фиксируется как версия. Без этих правил сравнение от месяца к месяцу ломается, и числам нет доверия.
Таксономия — не документ, который составили и забыли. Она меняется вместе с клиентами, но управляемо: новое значение добавляется, старое не удаляется, а отключается, а прошлые результаты либо остаются как есть, либо осознанно анализируются заново.
Поле, значение, уровень
Поле — один вопрос: «против чего возражал клиент?». Значение — один из возможных ответов: «цена», «время», «конкурент». Уровень — иерархия значений: «доставка» наверху, «задержка» и «повреждённая посылка» ниже. Для многих бизнесов достаточно двух уровней; больше трёх обычно делает нестабильным выбор и AI, и человека.
Правило 1: одно поле — один вопрос
Самая частая ошибка — сваливать всё в одно поле «тема»: названия продуктов, возражения, жалобы, намерения. В таком поле «цена» может быть и темой вопроса, и возражением, и жалобой, и число ничего не значит. Каждое поле должно задавать один вопрос: «о чём спросил?», «против чего возражал?», «почему не купил?». Когда поля разделены, пересечения (например, продукт × возражение) становятся осмысленными.
Правило 2: взаимоисключающие значения
Разговор, попавший в одно значение, не должен попадать и в другое значение того же поля — если поле однозначное. Если «цена» и «скидка» — разные значения, куда отнести вопрос «есть скидка?»? Такие пересечения нужно либо объединить, либо провести в определении ясную границу. Если у разговора действительно может быть несколько ответов (например, два возражения), сделайте поле многозначным, но значения всё равно не должны дублировать друг друга.
Правило 3: определение и примеры
- НазваниеКоротко, близко к языку клиента: «Срок доставки».
- ОпределениеОдно предложение: что относится к этому значению.
- Не входитГраница с ближайшим соседним значением: «стоимость доставки сюда не относится».
- Примеры2–3 фразы, которые клиенты реально писали, с опечатками.
Правило 4: «другое» и «неясно»
В каждом поле нужны два особых значения. «Другое» — клиент что-то сказал, но это не подходит ни под одно значение списка. «Неясно» — в разговоре нет информации для этого поля. Они разные: первое показывает, что список неполон, второе — что информации нет. Доля «другого» — индикатор качества списка: если она выше 15–20%, посмотрите на повторяющиеся там фразы и добавьте новое значение.
Правило 5: постоянный ключ, изменяемое название
У каждого значения два имени: метка, которую видит человек («Срок доставки»), и технический ключ, который хранит система («delivery_time»). Метку можно менять когда угодно — перевод, более ясная формулировка. Ключ после создания меняться не должен, потому что к нему привязаны прошлые результаты. Если ключ изменится, «delivery_time» этого месяца и «delivery_duration» прошлого будут считаться разными вещами, и тренд сломается.
Правило 6: версии и отключение
Когда значение больше не нужно, его не удаляют, а отключают: в новых разговорах оно не выбирается, но в прошлых результатах видно со своей меткой. Если удалить, в старых отчётах останется пробел или непонятный технический ключ. Каждое изменение записывайте в журнал: дата, что изменилось, почему. При существенном изменении списка значений подумайте о повторном анализе старых разговоров, чтобы старые и новые результаты не смешивались.
Как построить таксономию: шаги
- Вопросы для решенийДля каких решений? Каждое решение даёт одно-два поля.
- ЧтениеВручную прочитать 150–200 разговоров и записать кандидатов в значения.
- Черновик6–15 значений на поле плюс «другое» и «неясно», с определениями и границами.
- ТестДва человека отдельно категоризируют 50 разговоров; где они расходятся, там слабые определения.
- Запуск и калибровкаАнализ с AI, проверка на выборке в первые недели, уточнение определений.
Сколько значений оптимально
Слишком мало значений (3–4) делают результат общим: «проблема сервиса» ничего не говорит. Слишком много (30+) вызывают путаницу между соседними значениями, и на каждое приходится мало разговоров. На практике хорошо работают 6–15 значений на поле. Если нужно больше, разделите на два уровня: сначала верхняя категория, затем подкатегории.
Иллюстративный пример
Это иллюстративный пример. Страховое агентство начинает с 40 значений в поле «тема». Через две недели проверка показывает, что AI и операторы часто выбирают по-разному между «ценой полиса», «расчётом цены» и «скидками». Таксономию делят на два поля: «вид страхования» (авто, имущество, путешествия, здоровье, другое) и «тип вопроса» (цена, условия, документы, оплата, заявление о событии, другое). В каждом поле остаётся 6–7 значений.
Итог: пересечение «вид страхования × тип вопроса» даёт более ясную картину, чем прежние 40 значений, и согласие при проверке растёт.
Типичные ошибки
- Сваливать разные вопросы в одно поле.
- Строить категории по названиям отделов, а не по языку клиента.
- Удалять значения или менять их ключи.
- Не добавлять значение «другое» — AI вынужден записывать всё в ближайшее значение.
- Переписывать список каждый месяц.
Таксономия в Vexvon
В Vexvon поля и значения компания создаёт в своей панели: название, инструкция, закрытый список значений, одно или несколько значений. AI может выбирать только из списка; ключ значения создаётся один раз из метки и потом не меняется. Поле или значение с результатами не удаляется, а отключается; полное удаление требует отдельного подтверждения. Часто повторяющиеся фразы из «другого» видны отдельным списком, а после изменения списка значений старые разговоры можно принудительно проанализировать заново. Подробнее: аналитика Vexvon.
Следующий шаг
Возьмите свои текущие поля и проверьте каждое: задаёт ли оно один вопрос, есть ли «другое», есть ли у каждого значения строка «не входит»? Как найти темы с нуля — в статье анализ обращений клиентов; таксономию на ваших разговорах можно построить на демо.
Продолжение темы: проверка AI-категоризации, статус «неизвестно» в аналитике.
- Данные, таксономия и надёжность5 мин чтенияТочность транскрипции и аналитика: как ошибки искажают результаты
- Данные, таксономия и надёжность5 мин чтенияИнтеграция аналитики разговоров с CRM: как связать данные звонков и чатов
- Данные, таксономия и надёжность5 мин чтенияКонфиденциальность в аналитике разговоров: как защитить данные клиентов