Skip to main content
Аудиоанализ

Пилот речевой аналитики на существующих записях

Самый распространённый способ попробовать AI-анализ звонков — загрузить несколько записей, посмотреть результат и сказать «выглядит разумно». Это не оценка: заранее не записано, с чем сравнивается результат и что считать успехом. В статье строится пилот из семи шагов на существующих записях: выбор одной цели, стандарт звонка, репрезентативная выборка, эталон, оценённый людьми, заранее записанные критерии успеха, проведение пилота и решение — расширять, ограничить или остановить.

29 сентября 20266 мин чтения

Короткий ответ

Самый надёжный способ начать AI-анализ существующих записей звонков — небольшой пилот с записанной целью: один тип звонков, несколько десятков тщательно отобранных звонков вместо сотен, эталон, заранее оценённый людьми, и критерии успеха, согласованные до старта. В конце ответ должен быть не «нам понравилось», а «критерии выполнены, не выполнены или выполнены частично».

Цель пилота — не доказать, насколько хорош инструмент. Цель — до внедрения на всю команду узнать, что работает и что нет на ваших звонках, ваших языках и по вашим критериям.

Шаг 1: выберите одну цель

«Анализировать звонки» — не цель. Пилот должен отвечать на один конкретный вопрос:

  • Сократить время QA-специалиста на один звонок — первичную проверку делает AI, человек слушает только сомнительные случаи
  • Найти проблему, которую не видит выборочное прослушивание, — например, непроизнесённую обязательную информацию
  • Собрать доказательные примеры для обучения новых операторов
  • Увидеть, как стандарт звонка применяется в реальных разговорах

Цель определяет меру успеха. Если цель — экономия времени, мера — время. Если поиск проблем, мера — доля найденных случаев, подтверждённых проверкой человека.

Шаг 2: напишите стандарт звонка

AI оценивает звонок по вашим критериям. Если критерии нечёткие, нечётким будет и результат. Для пилота критерии должны быть простыми и проверяемыми:

  1. Один вопрос — один критерий«Уточнил ли оператор потребность и подстроил ли под неё предложение?» делится на два вопроса.
  2. Наблюдаемое поведениеНе «был вежлив», а «спросил имя клиента и в конце уточнил, остались ли вопросы».
  3. Правило «не применимо»Для каждого критерия записано, когда он не применяется: если возражения не было, критерий работы с возражением не применим.
  4. Без критерия тона голосаОценка по транскрипту надёжно не измеряет тон и интонацию. В руководстве Google Quality AI тоже советуют избегать таких вопросов.

Шаг 3: репрезентативная выборка звонков

Самая частая ошибка — брать только «хорошие» или только «проблемные» звонки. Выборка должна отражать повседневную реальность. Разбивка ниже — иллюстративный пример:

  1. Тип звонкаВыберите один тип — например, входящие продажи. Не смешивайте в пилоте продажи и поддержку.
  2. ОператорыНесколько операторов с разным опытом, а не только лучший или самый слабый.
  3. ЯзыкЯзыки вашей команды в пропорциях, близких к реальным, включая звонки со смешением языков.
  4. Качество записиНе только чистые записи — несколько шумных, коротких или оборванных тоже. Нужно знать, как они обрабатываются.
  5. ИсходЗвонки, закончившиеся продажей и без неё; с жалобой и без.

Универсального размера выборки нет. Google для настройки своей модели Quality AI требует минимум 100 примеров на вопрос и 40 на вариант ответа — это требование их продукта, а не норма для других инструментов. Практичный подход для пилота: по каждому важному критерию должно хватать примеров и с «да», и с «нет».

Шаг 4: эталон, оценённый людьми

Пилот нельзя оценить, не зная, с чем сравнивается результат AI. Эталон — это те же звонки, оценённые людьми по тем же критериям.

  • Каждый звонок независимо оценивают два человека, не видя ответов друг друга
  • Критерии, где люди разошлись, отмечаются отдельно; часто это плохо сформулированные критерии
  • Расхождения обсуждаются и записывается согласованный ответ — это и есть эталон
  • Ответ человека не считается автоматически безошибочным; для этого и нужен этап согласования

Шаг 5: заранее запишите критерии успеха

Критерии успеха записываются до начала пилота, а не после просмотра результатов. Ниже — иллюстративный пример; пороги задайте под свою цель:

  1. Согласие по критериюДля каждого критерия — доля звонков, где ответ AI совпал с эталоном. Не одно общее среднее, а по каждому критерию: один может быть очень хорош, другой слаб.
  2. Тип ошибки на критических критерияхЕсли на критическом критерии AI сказал «выполнен», а человек «нет», это самая опасная ошибка, и она считается отдельно.
  3. Доля неанализируемых звонковСколько звонков не удалось надёжно оценить из-за качества звука, языка или разделения говорящих.
  4. Время специалистаСколько времени уходит на проверку одного звонка с результатом AI и без него.

Шаг 6: проведите пилот

  1. Подготовьте записиВыгрузите отобранные звонки из телефонии и дайте файлам понятные имена — дата, тип звонка, неперсональный идентификатор.
  2. ПроанализируйтеЗагрузите звонки, выберите стандарт звонка, дождитесь результатов. Отметьте неудачные файлы с причиной.
  3. СравнитеПо каждому звонку сверьте результат AI с эталоном по каждому критерию. Где есть расхождение, прочитайте транскрипт: причина в формулировке критерия, ошибке распознавания или трактовке AI?
  4. Исправьте критерииУточните плохо сформулированные критерии и проанализируйте те же звонки снова. Обычно этот цикл повторяется несколько раз.

Шаг 7: решение

  1. РасширятьКритерии успеха выполнены. Дальше — второй тип звонков или больше операторов, с продолжением выборочной проверки человеком.
  2. Ограниченное применениеОдни критерии надёжны, другие нет. Надёжные используются, остальные остаются за людьми или переписываются.
  3. ОстановитьНа ключевых критериях согласие слабое или большую часть звонков нельзя проанализировать — например, из-за качества записи. Расширять, не устранив причину, бессмысленно.

Типичные ошибки

  • Записать критерии успеха после пилота
  • Пилот без эталона: «результаты выглядят разумно» — не оценка
  • Отобрать только чистые, хорошие записи — в реальной работе будут сюрпризы
  • Сразу использовать результаты пилота для оценки операторов
  • Начать слишком широко: пять типов звонков, двадцать критериев, три языка одновременно

Ограничения

  • Согласие, полученное в пилоте, верно только для этого типа звонков, языка и качества записи
  • Требования к согласию и конфиденциальности при использовании записей зависят от страны и проверяются до пилота
  • Плохая или неполная запись не должна засчитываться как результат против оператора
  • Во время пилота AI-баллы не используются для решений об операторах

Пилот с Vexvon Audio Analyzer

  • Существующие записи загружаются файлами — mp3, wav, m4a, ogg, opus, flac, amr, wma и другие форматы; до 10 файлов за одну загрузку, до 200 МБ каждый
  • Повторная загрузка того же файла распознаётся, и система предупреждает об этом
  • Стандарт звонка вы пишете текстом; на каждом звонке каждый шаг оценивается как «выполнен», «частично», «пропущен» или «не применим», с комментарием и строками транскрипта
  • После исправления критериев те же звонки переанализируются по существующему транскрипту — без повторного распознавания аудио
  • Неудачный файл показывается с причиной и может быть поставлен в очередь снова без повторной загрузки

Подробнее: Vexvon Audio Analyzer. Как качество записи влияет на результат, разбирается в статьях раздела внедрение и надёжность аудиоанализа.

Первый шаг

Напишите план пилота на одну страницу: цель, тип звонков, разбивка выборки, кто готовит эталон и критерии успеха. Затем отберите 30–50 звонков и отдайте их двум людям на независимую оценку. Чтобы провести пилот на своих записях, свяжитесь с нами.

Продолжение темы: программа для анализа звонков, точность анализа звонков, качество записи звонка.

Live demo

Ready? Let's start

See Vexvon live in a 10-minute demo.

  • A scenario built for your business
  • A live sample call
  • A tour of the platform
Get a demoorBook a meeting

Your details are used only for the demo and to get in touch.