Аудиоанализ и анализ транскрипта: тон, эмпатия и текст
Спрашивать систему, работающую по транскрипту, «говорил ли оператор дружелюбным голосом?» — значит задавать вопрос, на который у неё нет ответа. В статье разделено, что надёжно устанавливается по тексту звонка, что требует подходящего аудио и инструментов, а что не устанавливается надёжно ничем; дана иллюстративная таблица границ и показано, как перевести эмпатию, внимательность и профессионализм в поведение, видимое в тексте, с примером одной фразы в двух прочтениях и пятью вопросами к инструменту аудиоанализа.
Короткий ответ
Анализ транскрипта оценивает, что было сказано в звонке: какой вопрос задал оператор, какую цену назвал, что пообещал, как завершил разговор. Аудиоанализ пытается измерить, как это было сказано: тон голоса, темп, громкость, паузы. Первое охватывает большую часть поведения оператора и легко проверяется. Второе требует подходящего аудио, специальных инструментов и отдельной проверки. Есть и третья группа: то, что ни текст, ни звук надёжно не устанавливают, — например, был ли оператор «на самом деле» эмпатичным.
Знать эту границу важно при составлении формы оценки. Спрашивать систему, работающую по транскрипту, «говорил ли оператор дружелюбным голосом?» — значит задавать вопрос, на который у неё нет ответа.
Что надёжно устанавливается по тексту
- Названные факты: цена, дата, условия, название продукта — если транскрипт верен
- Были ли заданы вопросы: «оператор спросил о бюджете»
- Прозвучали ли обязательные фразы: раскрытие, подтверждение, условия
- Обещания и обязательства: «мы перезвоним завтра», «деньги вернут»
- Структура звонка: приветствие, уточнение потребности, предложение, завершение
- Запрещённые фразы и неверная информация клиенту
Всё из этого списка видно в словах и подтверждается строкой транскрипта. Именно здесь основная часть оценки оператора.
Что требует звука
Следующее заключено в самом звуке, а не в словах. Для измерения нужны инструмент аудиоанализа, записи достаточного качества и проверка на ваших звонках:
- Тон и интонация — «я понимаю» можно сказать искренне, а можно с сарказмом
- Темп речи — клиент может не успевать за оператором, который говорит слишком быстро
- Громкость и её изменения — повышение голоса
- Точная длительность пауз и удержаний
- Длительность наложения речи и кто кого перебил
В руководстве Google Quality AI прямо сказано, что оценка по транскрипту не проводит акустический анализ. В документации AWS по оценке тоже рекомендуют избегать вопросов о качествах, видных только в аудио, — громкости, тоне и темпе.
Чего не устанавливает ни то, ни другое
- Внутренние чувства и намерения оператора — «чувствовал» ли он эмпатию
- Настоящее настроение клиента — слова и голос не показывают его внутреннее состояние точно
- Личность и характер оператора — такие выводы по голосу и манере речи делать нельзя
- Защищённые признаки — возраст, пол, этническая принадлежность, здоровье; их нельзя угадывать по голосу и использовать в оценке
- Что произошло после звонка — запись в CRM, возврат, обещанный перезвон
Иллюстративная таблица границ
Таблица ниже — иллюстративный пример: типичные критерии и источник, по которому их можно проверить.
- «Оператор представился»Текст: да. Видно в словах.
- «Оператор назвал точную цену»Текст: да, но числа чувствительны к ошибкам распознавания — если критерий критический, проверяет человек.
- «Оператор говорил спокойным, дружелюбным голосом»Текст: нет. Аудио: только с подходящим инструментом и проверкой. Лучше — перевести в поведение.
- «Оператор слушал клиента»Напрямую — ни то, ни другое. Переводится в поведение: «пересказал слова клиента своими словами», «не задал один вопрос дважды».
- «Оператор был эмпатичен»Надёжно — ни то, ни другое. Переводится в поведение: «признал недовольство», «объяснил, что возможно».
- «Клиент остался доволен»Не по звонку — по опросу клиента или его дальнейшему поведению.
Как перевести субъективный критерий в поведение
Субъективные строки формы не нужно удалять — их нужно перевести в поведение, видимое в тексте. Метод простой: спросите «если бы это качество было, что сказал бы оператор?»
- ЭмпатияПересказал проблему клиента своими словами; открыто признал недовольство.
- ВнимательностьНе переспрашивал уже названную клиентом информацию; не забыл второй вопрос.
- ПрофессионализмДал точную информацию; на вопрос, которого не знал, не гадал, а сказал, что уточнит.
- ВежливостьНе перебивал клиента; в конце спросил, остались ли у него вопросы.
Когда нужен аудиоанализ
Иногда сам звук действительно важен — например, точная длительность удержания или то, что оператор говорит одновременно с клиентом. Если такой критерий нужен:
- Проверьте по документации и на своих звонках, что инструмент измеряет этот показатель
- Убедитесь, что качества записи и схемы каналов достаточно
- Сравните результат с оценкой людей
- Используйте показатель как критерий отбора для разбора, а не как автоматический балл
Иллюстративный пример: одна фраза, два прочтения
Пример ниже — иллюстративный. В двух звонках в транскрипте одна и та же строка: оператор говорит «Понимаю, это действительно неприятно».
- Первый звонокОператор говорит это спокойно, затем спрашивает номер заказа и объясняет новую дату. Клиент отвечает «хорошо, подожду» и заканчивает разговор.
- Второй звонокОператор говорит ту же фразу с сарказмом, со вздохом и сразу добавляет «но таковы правила». Клиент говорит «вы надо мной издеваетесь».
Оценка по транскрипту засчитает «недовольство признано» в обоих звонках. Разницу показывает звук — но и текст даёт подсказки: во втором звонке после признания нет решения, а следующая фраза клиента показывает рост недовольства. Поэтому критерий «признал и затем объяснил, что возможно» ловит гораздо больше, даже без измерения тона.
Пять вопросов к инструменту, обещающему аудиоанализ
- Что именно измеряет этот показатель и как он считается?
- На каких языках и при каком качестве записи он проверялся?
- Сравнивался ли результат с оценкой людей и как?
- Отличается ли результат на стерео- и моно-записях?
- Как показатель следует использовать в решениях об операторах — и как не следует?
Типичные ошибки
- Ждать от системы, работающей по транскрипту, решений о тоне и интонации
- Принимать цифры вроде «балла эмпатии», не зная, что они измеряют
- Делать выводы о характере оператора по его голосу и манере речи
- Читать метку сентимента как измерение тона голоса
Ограничения
- У транскрипта свои ошибки; факты из текста зависят от качества распознавания
- Аудиопоказатели чувствительны к качеству записи, схеме каналов и языку
- Аудиопоказатель одного инструмента нельзя напрямую сравнивать с другим
- Защищённые признаки нельзя угадывать по голосу и использовать в оценке
Что есть в Vexvon Audio Analyzer
- Запись переводится в текст, каждая строка относится к оператору, клиенту или «неизвестному»
- Шаги вашего стандарта звонка оцениваются по транскрипту как «выполнен», «частично», «пропущен» или «не применим», со строками-доказательствами
- При изменении стандарта оценка повторяется по существующему транскрипту — то есть оценка опирается на текст
- Отдельных показателей тона голоса, интонации и темпа речи нет
Подробнее: Vexvon Audio Analyzer. Как трактовать паузы и перебивания, — в статье паузы и перебивания в звонке, а границы сентимента — в статье сентимент клиента и качество оператора.
Первый шаг
Откройте свою форму оценки и напишите рядом с каждой строкой: текст, звук или ни то, ни другое? Строки «ни то, ни другое» переведите в поведение методом выше. Статья входит в раздел внедрение и надёжность аудиоанализа. Чтобы проверить подход на своих записях, свяжитесь с нами.
Продолжение темы: диаризация звонков.