Skip to main content
Стратегия анализа звонков

Выборочная проверка звонков и полный охват: охват — не точность

Полный охват помогает находить проблемные звонки, но не доказывает, что результат верен. В этом материале объясняем новую роль выборочной проверки звонков: показываем три числа, разделяющие охват, пригодность и точность, на примере расчёта, перечисляем правила для непригодных звонков и описываем, как выбрать выборку, проверяющую саму систему.

29 сентября 20266 мин чтения

Короткий ответ

Анализ всех звонков повышает шанс найти проблемный звонок, но не делает оценку точнее. Это два разных вопроса. Охват отвечает на вопрос «сколько звонков просмотрено», точность — «верен ли результат, выставленный звонку». Есть и третье число, которое часто вообще не измеряют: сколько проанализированных звонков были пригодны для анализа.

Выборочная проверка звонков — прослушивание людьми небольшой их части — не исчезает при полном охвате. Меняется её роль: раньше она была нужна для оценки операторов, теперь — для проверки самой системы.

Старая проблема выборки

В классическом контроле качества каждый месяц прослушивают несколько звонков каждого оператора. Выборка мала и часто не случайна: выбирают звонки с жалобами, длинные или запомнившиеся тимлиду. В итоге мнение об операторе складывается по его худшим или случайным дням. Подробнее об этой проблеме — в материале об аудите качества звонков.

AI-анализ частично её решает: система может просмотреть сотни звонков по одним критериям. Но появляется новая ловушка — фраза «мы посмотрели все» звучит как «мы все оценили правильно».

Иллюзия полного охвата

Не каждый проанализированный звонок пригоден для оценки. Звонок, попавший на голосовую почту, запись, где не слышна одна из сторон, очень шумный разговор, десятисекундный звонок, где клиент сказал «перезвоню» и положил трубку, — всё это анализируется и всё получает какой-то результат. Если такие результаты попадают в общую статистику, искажаются и средний балл, и сравнение операторов.

Вторая иллюзия связана со статусом «неприменимо». Если большинство критериев к звонку не применимы, балл опирается на очень малое их число. Звонок, выполнивший два критерия из двух, получает высокий балл, но он не так надёжен, как звонок, выполнивший девять из десяти.

Три числа — три вопроса

Показывайте эти три показателя в отчёте о качестве отдельно. Цифры ниже — иллюстративный пример, а не реальная компания:

95%Охват: из 2 000 звонков за месяц проанализировано 1 900
90%Пригодность: из 1 900 проанализированных для оценки пригодны 1 710
85,5%Надёжный охват: 1 710 ÷ 2 000 — доля звонков, на результат которых можно опираться

Точность — третье, отдельное число, и берётся оно только из проверочной выборки. Допустим, человек независимо оценил 120 звонков: по критерию «согласован ли следующий шаг» AI пришёл к тому же результату в 108 звонках (90%), а по критерию «выяснена ли потребность» — в 96 (80%). Это значит, что второй критерий нужно сформулировать точнее, — а об операторах это пока ничего не говорит.

Как отделять непригодные звонки

Запишите правила непригодности заранее, чтобы звонок откладывался по объективному признаку, а не из-за результата оценки:

  • Звонок короче минимума, установленного компанией, и содержательного разговора в нём нет
  • Одну из сторон не слышно, или большая часть говорящих осталась «неизвестной»
  • Значительная часть транскрипта — плохо распознанные строки
  • Звонок попал на голосовую почту, автоответчик или не по адресу
  • Разговор идёт на языке или относится к типу звонка, для которых форма не предназначена

Непригодный звонок не засчитывается против оператора и не входит в знаменатель общего балла. Но его считают отдельно: если доля непригодных звонков в какой-то смене резко выросла, проблема может быть в телефонии или настройках записи.

Как выбирать проверочную выборку

При полном охвате выборка нужна для проверки системы, поэтому она должна охватывать все её результаты, а не только плохие:

  1. Разделите на слоиСоздайте группы по типу звонка, смене и языку и берите звонки из каждой.
  2. Охватите диапазоны балловБерите звонки с низким, средним и высоким баллом — ошибки, где AI написал «выполнено», видны только среди звонков с высоким баллом.
  3. Оценивайте независимоПроверяющий не должен заранее видеть результат AI, иначе он склонен с ним соглашаться.
  4. Сравнивайте по критериямСчитайте совпадение по каждому критерию отдельно, а не по всей форме.
  5. Измеряйте и совпадение между людьмиПусть одни и те же звонки оценят два специалиста. Если люди не согласны друг с другом, ждать совпадения от AI бессмысленно.

Универсального числа для размера выборки нет. Например, руководство Google по Quality AI требует не менее 100 примеров разговоров на вопрос для обучения своей модели — это требование конкретного продукта, а не правило для любой системы. Практический критерий такой: по каждому критерию должно быть достаточно примеров «да» и «нет», чтобы увидеть расхождения.

Надёжный охват различается по операторам

Три числа различаются не только по компании, но и по операторам, и это напрямую меняет сравнение. Иллюстративный пример: у оператора дневной смены из 300 звонков за месяц пригодны 285, а у коллеги из ночной смены — только 210 из 300: на ночную линию попадает больше шумных мобильных звонков и обрывов связи. Если у обоих средний балл 78, первое число опирается на 285 звонков, второе — на 210.

Отсюда два практических вывода. Во-первых, в отчёте по оператору рядом с баллом нужно показывать, на скольких пригодных звонках он основан. Во-вторых, долю непригодных звонков нельзя читать как показатель самого оператора: чаще это свойство смены, линии или потока клиентов. Для справедливого сравнения операторов тип звонка, смена и размер выборки всегда указываются рядом с баллом.

Ограничения

Высокое совпадение не доказывает, что система всегда права, — только на проверенной выборке и в проверенный период. При изменении типов звонков, сценариев или продуктов совпадение нужно измерять заново. Оценка человека тоже не является автоматически «правильным ответом», поэтому совпадение между людьми отслеживается отдельно. И наконец, решение откладывать непригодные звонки тоже документируется, чтобы им не пользовались для сокрытия неудобных примеров.

Что показывает Vexvon Audio Analyzer

Vexvon Audio Analyzer показывает на уровне звонка сигналы, нужные для этих трёх чисел:

  • По каждому запуску анализа видно, сколько файлов обработано и сколько завершились ошибкой; неудавшуюся запись можно снова поставить в очередь без повторной загрузки
  • Плохо распознанные строки помечаются в транскрипте, строка с неопределённым говорящим остаётся «неизвестной»
  • Шаг стандарта, не относящийся к звонку, получает статус «неприменимо» и не засчитывается против оператора
  • Каждый статус приходит со ссылками на строки транскрипта — проверяющий сравнивает результат с доказательством

Правило пригодности, проверочная выборка и таблица совпадений — это ваш процесс контроля качества. Разделение работы между AI и людьми подробно описано в материале об автоматизированном контроле качества звонков.

Первый шаг

Добавьте в следующий отчёт о качестве две строки: долю звонков, пригодных для анализа, и совпадение AI и человека хотя бы по двум критериям. В первый месяц эти числа могут выглядеть тревожно — это нормально, ведь раньше их вообще не измеряли. Другие материалы — в рубрике стратегия анализа звонков; чтобы проверить на своих звонках, свяжитесь с нами.

Продолжение темы: качество записи звонка, точность анализа звонков.

Live demo

Ready? Let's start

See Vexvon live in a 10-minute demo.

  • A scenario built for your business
  • A live sample call
  • A tour of the platform
Get a demoorBook a meeting

Your details are used only for the demo and to get in touch.