Пилот речевой аналитики на существующих записях
Самый распространённый способ попробовать AI-анализ звонков — загрузить несколько записей, посмотреть результат и сказать «выглядит разумно». Это не оценка: заранее не записано, с чем сравнивается результат и что считать успехом. В статье строится пилот из семи шагов на существующих записях: выбор одной цели, стандарт звонка, репрезентативная выборка, эталон, оценённый людьми, заранее записанные критерии успеха, проведение пилота и решение — расширять, ограничить или остановить.
Короткий ответ
Самый надёжный способ начать AI-анализ существующих записей звонков — небольшой пилот с записанной целью: один тип звонков, несколько десятков тщательно отобранных звонков вместо сотен, эталон, заранее оценённый людьми, и критерии успеха, согласованные до старта. В конце ответ должен быть не «нам понравилось», а «критерии выполнены, не выполнены или выполнены частично».
Цель пилота — не доказать, насколько хорош инструмент. Цель — до внедрения на всю команду узнать, что работает и что нет на ваших звонках, ваших языках и по вашим критериям.
Шаг 1: выберите одну цель
«Анализировать звонки» — не цель. Пилот должен отвечать на один конкретный вопрос:
- Сократить время QA-специалиста на один звонок — первичную проверку делает AI, человек слушает только сомнительные случаи
- Найти проблему, которую не видит выборочное прослушивание, — например, непроизнесённую обязательную информацию
- Собрать доказательные примеры для обучения новых операторов
- Увидеть, как стандарт звонка применяется в реальных разговорах
Цель определяет меру успеха. Если цель — экономия времени, мера — время. Если поиск проблем, мера — доля найденных случаев, подтверждённых проверкой человека.
Шаг 2: напишите стандарт звонка
AI оценивает звонок по вашим критериям. Если критерии нечёткие, нечётким будет и результат. Для пилота критерии должны быть простыми и проверяемыми:
- Один вопрос — один критерий«Уточнил ли оператор потребность и подстроил ли под неё предложение?» делится на два вопроса.
- Наблюдаемое поведениеНе «был вежлив», а «спросил имя клиента и в конце уточнил, остались ли вопросы».
- Правило «не применимо»Для каждого критерия записано, когда он не применяется: если возражения не было, критерий работы с возражением не применим.
- Без критерия тона голосаОценка по транскрипту надёжно не измеряет тон и интонацию. В руководстве Google Quality AI тоже советуют избегать таких вопросов.
Шаг 3: репрезентативная выборка звонков
Самая частая ошибка — брать только «хорошие» или только «проблемные» звонки. Выборка должна отражать повседневную реальность. Разбивка ниже — иллюстративный пример:
- Тип звонкаВыберите один тип — например, входящие продажи. Не смешивайте в пилоте продажи и поддержку.
- ОператорыНесколько операторов с разным опытом, а не только лучший или самый слабый.
- ЯзыкЯзыки вашей команды в пропорциях, близких к реальным, включая звонки со смешением языков.
- Качество записиНе только чистые записи — несколько шумных, коротких или оборванных тоже. Нужно знать, как они обрабатываются.
- ИсходЗвонки, закончившиеся продажей и без неё; с жалобой и без.
Универсального размера выборки нет. Google для настройки своей модели Quality AI требует минимум 100 примеров на вопрос и 40 на вариант ответа — это требование их продукта, а не норма для других инструментов. Практичный подход для пилота: по каждому важному критерию должно хватать примеров и с «да», и с «нет».
Шаг 4: эталон, оценённый людьми
Пилот нельзя оценить, не зная, с чем сравнивается результат AI. Эталон — это те же звонки, оценённые людьми по тем же критериям.
- Каждый звонок независимо оценивают два человека, не видя ответов друг друга
- Критерии, где люди разошлись, отмечаются отдельно; часто это плохо сформулированные критерии
- Расхождения обсуждаются и записывается согласованный ответ — это и есть эталон
- Ответ человека не считается автоматически безошибочным; для этого и нужен этап согласования
Шаг 5: заранее запишите критерии успеха
Критерии успеха записываются до начала пилота, а не после просмотра результатов. Ниже — иллюстративный пример; пороги задайте под свою цель:
- Согласие по критериюДля каждого критерия — доля звонков, где ответ AI совпал с эталоном. Не одно общее среднее, а по каждому критерию: один может быть очень хорош, другой слаб.
- Тип ошибки на критических критерияхЕсли на критическом критерии AI сказал «выполнен», а человек «нет», это самая опасная ошибка, и она считается отдельно.
- Доля неанализируемых звонковСколько звонков не удалось надёжно оценить из-за качества звука, языка или разделения говорящих.
- Время специалистаСколько времени уходит на проверку одного звонка с результатом AI и без него.
Шаг 6: проведите пилот
- Подготовьте записиВыгрузите отобранные звонки из телефонии и дайте файлам понятные имена — дата, тип звонка, неперсональный идентификатор.
- ПроанализируйтеЗагрузите звонки, выберите стандарт звонка, дождитесь результатов. Отметьте неудачные файлы с причиной.
- СравнитеПо каждому звонку сверьте результат AI с эталоном по каждому критерию. Где есть расхождение, прочитайте транскрипт: причина в формулировке критерия, ошибке распознавания или трактовке AI?
- Исправьте критерииУточните плохо сформулированные критерии и проанализируйте те же звонки снова. Обычно этот цикл повторяется несколько раз.
Шаг 7: решение
- РасширятьКритерии успеха выполнены. Дальше — второй тип звонков или больше операторов, с продолжением выборочной проверки человеком.
- Ограниченное применениеОдни критерии надёжны, другие нет. Надёжные используются, остальные остаются за людьми или переписываются.
- ОстановитьНа ключевых критериях согласие слабое или большую часть звонков нельзя проанализировать — например, из-за качества записи. Расширять, не устранив причину, бессмысленно.
Типичные ошибки
- Записать критерии успеха после пилота
- Пилот без эталона: «результаты выглядят разумно» — не оценка
- Отобрать только чистые, хорошие записи — в реальной работе будут сюрпризы
- Сразу использовать результаты пилота для оценки операторов
- Начать слишком широко: пять типов звонков, двадцать критериев, три языка одновременно
Ограничения
- Согласие, полученное в пилоте, верно только для этого типа звонков, языка и качества записи
- Требования к согласию и конфиденциальности при использовании записей зависят от страны и проверяются до пилота
- Плохая или неполная запись не должна засчитываться как результат против оператора
- Во время пилота AI-баллы не используются для решений об операторах
Пилот с Vexvon Audio Analyzer
- Существующие записи загружаются файлами — mp3, wav, m4a, ogg, opus, flac, amr, wma и другие форматы; до 10 файлов за одну загрузку, до 200 МБ каждый
- Повторная загрузка того же файла распознаётся, и система предупреждает об этом
- Стандарт звонка вы пишете текстом; на каждом звонке каждый шаг оценивается как «выполнен», «частично», «пропущен» или «не применим», с комментарием и строками транскрипта
- После исправления критериев те же звонки переанализируются по существующему транскрипту — без повторного распознавания аудио
- Неудачный файл показывается с причиной и может быть поставлен в очередь снова без повторной загрузки
Подробнее: Vexvon Audio Analyzer. Как качество записи влияет на результат, разбирается в статьях раздела внедрение и надёжность аудиоанализа.
Первый шаг
Напишите план пилота на одну страницу: цель, тип звонков, разбивка выборки, кто готовит эталон и критерии успеха. Затем отберите 30–50 звонков и отдайте их двум людям на независимую оценку. Чтобы провести пилот на своих записях, свяжитесь с нами.
Продолжение темы: программа для анализа звонков, точность анализа звонков, качество записи звонка.