Skip to main content
Аудиоанализ

Аудиоанализ и анализ транскрипта: тон, эмпатия и текст

Спрашивать систему, работающую по транскрипту, «говорил ли оператор дружелюбным голосом?» — значит задавать вопрос, на который у неё нет ответа. В статье разделено, что надёжно устанавливается по тексту звонка, что требует подходящего аудио и инструментов, а что не устанавливается надёжно ничем; дана иллюстративная таблица границ и показано, как перевести эмпатию, внимательность и профессионализм в поведение, видимое в тексте, с примером одной фразы в двух прочтениях и пятью вопросами к инструменту аудиоанализа.

29 сентября 20266 мин чтения

Короткий ответ

Анализ транскрипта оценивает, что было сказано в звонке: какой вопрос задал оператор, какую цену назвал, что пообещал, как завершил разговор. Аудиоанализ пытается измерить, как это было сказано: тон голоса, темп, громкость, паузы. Первое охватывает большую часть поведения оператора и легко проверяется. Второе требует подходящего аудио, специальных инструментов и отдельной проверки. Есть и третья группа: то, что ни текст, ни звук надёжно не устанавливают, — например, был ли оператор «на самом деле» эмпатичным.

Знать эту границу важно при составлении формы оценки. Спрашивать систему, работающую по транскрипту, «говорил ли оператор дружелюбным голосом?» — значит задавать вопрос, на который у неё нет ответа.

Что надёжно устанавливается по тексту

  • Названные факты: цена, дата, условия, название продукта — если транскрипт верен
  • Были ли заданы вопросы: «оператор спросил о бюджете»
  • Прозвучали ли обязательные фразы: раскрытие, подтверждение, условия
  • Обещания и обязательства: «мы перезвоним завтра», «деньги вернут»
  • Структура звонка: приветствие, уточнение потребности, предложение, завершение
  • Запрещённые фразы и неверная информация клиенту

Всё из этого списка видно в словах и подтверждается строкой транскрипта. Именно здесь основная часть оценки оператора.

Что требует звука

Следующее заключено в самом звуке, а не в словах. Для измерения нужны инструмент аудиоанализа, записи достаточного качества и проверка на ваших звонках:

  • Тон и интонация — «я понимаю» можно сказать искренне, а можно с сарказмом
  • Темп речи — клиент может не успевать за оператором, который говорит слишком быстро
  • Громкость и её изменения — повышение голоса
  • Точная длительность пауз и удержаний
  • Длительность наложения речи и кто кого перебил

В руководстве Google Quality AI прямо сказано, что оценка по транскрипту не проводит акустический анализ. В документации AWS по оценке тоже рекомендуют избегать вопросов о качествах, видных только в аудио, — громкости, тоне и темпе.

Чего не устанавливает ни то, ни другое

  • Внутренние чувства и намерения оператора — «чувствовал» ли он эмпатию
  • Настоящее настроение клиента — слова и голос не показывают его внутреннее состояние точно
  • Личность и характер оператора — такие выводы по голосу и манере речи делать нельзя
  • Защищённые признаки — возраст, пол, этническая принадлежность, здоровье; их нельзя угадывать по голосу и использовать в оценке
  • Что произошло после звонка — запись в CRM, возврат, обещанный перезвон

Иллюстративная таблица границ

Таблица ниже — иллюстративный пример: типичные критерии и источник, по которому их можно проверить.

  1. «Оператор представился»Текст: да. Видно в словах.
  2. «Оператор назвал точную цену»Текст: да, но числа чувствительны к ошибкам распознавания — если критерий критический, проверяет человек.
  3. «Оператор говорил спокойным, дружелюбным голосом»Текст: нет. Аудио: только с подходящим инструментом и проверкой. Лучше — перевести в поведение.
  4. «Оператор слушал клиента»Напрямую — ни то, ни другое. Переводится в поведение: «пересказал слова клиента своими словами», «не задал один вопрос дважды».
  5. «Оператор был эмпатичен»Надёжно — ни то, ни другое. Переводится в поведение: «признал недовольство», «объяснил, что возможно».
  6. «Клиент остался доволен»Не по звонку — по опросу клиента или его дальнейшему поведению.

Как перевести субъективный критерий в поведение

Субъективные строки формы не нужно удалять — их нужно перевести в поведение, видимое в тексте. Метод простой: спросите «если бы это качество было, что сказал бы оператор?»

  1. ЭмпатияПересказал проблему клиента своими словами; открыто признал недовольство.
  2. ВнимательностьНе переспрашивал уже названную клиентом информацию; не забыл второй вопрос.
  3. ПрофессионализмДал точную информацию; на вопрос, которого не знал, не гадал, а сказал, что уточнит.
  4. ВежливостьНе перебивал клиента; в конце спросил, остались ли у него вопросы.

Когда нужен аудиоанализ

Иногда сам звук действительно важен — например, точная длительность удержания или то, что оператор говорит одновременно с клиентом. Если такой критерий нужен:

  • Проверьте по документации и на своих звонках, что инструмент измеряет этот показатель
  • Убедитесь, что качества записи и схемы каналов достаточно
  • Сравните результат с оценкой людей
  • Используйте показатель как критерий отбора для разбора, а не как автоматический балл

Иллюстративный пример: одна фраза, два прочтения

Пример ниже — иллюстративный. В двух звонках в транскрипте одна и та же строка: оператор говорит «Понимаю, это действительно неприятно».

  1. Первый звонокОператор говорит это спокойно, затем спрашивает номер заказа и объясняет новую дату. Клиент отвечает «хорошо, подожду» и заканчивает разговор.
  2. Второй звонокОператор говорит ту же фразу с сарказмом, со вздохом и сразу добавляет «но таковы правила». Клиент говорит «вы надо мной издеваетесь».

Оценка по транскрипту засчитает «недовольство признано» в обоих звонках. Разницу показывает звук — но и текст даёт подсказки: во втором звонке после признания нет решения, а следующая фраза клиента показывает рост недовольства. Поэтому критерий «признал и затем объяснил, что возможно» ловит гораздо больше, даже без измерения тона.

Пять вопросов к инструменту, обещающему аудиоанализ

  • Что именно измеряет этот показатель и как он считается?
  • На каких языках и при каком качестве записи он проверялся?
  • Сравнивался ли результат с оценкой людей и как?
  • Отличается ли результат на стерео- и моно-записях?
  • Как показатель следует использовать в решениях об операторах — и как не следует?

Типичные ошибки

  • Ждать от системы, работающей по транскрипту, решений о тоне и интонации
  • Принимать цифры вроде «балла эмпатии», не зная, что они измеряют
  • Делать выводы о характере оператора по его голосу и манере речи
  • Читать метку сентимента как измерение тона голоса

Ограничения

  • У транскрипта свои ошибки; факты из текста зависят от качества распознавания
  • Аудиопоказатели чувствительны к качеству записи, схеме каналов и языку
  • Аудиопоказатель одного инструмента нельзя напрямую сравнивать с другим
  • Защищённые признаки нельзя угадывать по голосу и использовать в оценке

Что есть в Vexvon Audio Analyzer

  • Запись переводится в текст, каждая строка относится к оператору, клиенту или «неизвестному»
  • Шаги вашего стандарта звонка оцениваются по транскрипту как «выполнен», «частично», «пропущен» или «не применим», со строками-доказательствами
  • При изменении стандарта оценка повторяется по существующему транскрипту — то есть оценка опирается на текст
  • Отдельных показателей тона голоса, интонации и темпа речи нет

Подробнее: Vexvon Audio Analyzer. Как трактовать паузы и перебивания, — в статье паузы и перебивания в звонке, а границы сентимента — в статье сентимент клиента и качество оператора.

Первый шаг

Откройте свою форму оценки и напишите рядом с каждой строкой: текст, звук или ни то, ни другое? Строки «ни то, ни другое» переведите в поведение методом выше. Статья входит в раздел внедрение и надёжность аудиоанализа. Чтобы проверить подход на своих записях, свяжитесь с нами.

Продолжение темы: диаризация звонков.

Live demo

Ready? Let's start

See Vexvon live in a 10-minute demo.

  • A scenario built for your business
  • A live sample call
  • A tour of the platform
Get a demoorBook a meeting

Your details are used only for the demo and to get in touch.