Оценка операторов на трёх языках: как проверять QA-скоринг
В Баку в одном звонке часто смешиваются азербайджанский и русский, а названия продуктов и тарифов звучат по-английски. Система оценки, хорошо работающая на одном языке, может ошибаться на другом — и систематически занижать балл операторов, которые на нём работают. В статье — пять различий между языками, иллюстративный тестовый набор, почему переведённый транскрипт не доказательство, критерии, не зависящие от языка, словарь терминов и честное сравнение языковых групп.
Короткий ответ
В многоязычном колл-центре оценку операторов нужно проверять для каждого языка отдельно. Система, хорошо работающая на одном языке, может не давать того же на другом: качество распознавания, разделение говорящих и трактовка критериев различаются. В Баку реальность ещё сложнее — в одном звонке смешиваются азербайджанский и русский, а названия продуктов звучат по-английски.
Поэтому вопрос не «знает ли система азербайджанский?». Вопрос в другом: насколько на ваших звонках, с вашей терминологией и вашими критериями результат совпадает с оценкой людей для каждого языка и каждой языковой смеси? Это показывает только отдельный тестовый набор.
Что различается между языками
- Качество распознаванияТочность перевода речи в текст зависит от языка. Число или имя, хорошо распознанное на одном языке, на другом может быть записано с ошибкой.
- Диалект и акцентБакинское, гянджинское или нахичеванское произношение, акцент азербайджанца, говорящего по-русски, — всё это влияет на распознавание.
- Переключение кодовАзербайджанская фраза с русскими словами «скидка» и «доставка» посередине — норма для многоязычного региона, но трудность для автоматического распознавания.
- Отраслевые терминыНазвания тарифов, коды продуктов, банковские термины. Если система их не знает, она подставляет похожее слово.
- Вежливость и стильФраза, вежливая на одном языке, на другом может звучать холодно. Критерии стиля трактуются по-разному в зависимости от языка.
Иллюстративный тестовый набор
Схема ниже — иллюстративный пример. Цель — увидеть результат для каждого языка и языковой смеси отдельно; цифры подстройте под свой поток звонков.
- Языковые группыТолько азербайджанский, только русский, только английский и смешанные звонки — каждая группа отдельно.
- Разнообразие внутри группыРазные операторы, профили клиентов и типы звонков; несколько шумных записей.
- ТерминологияВ каждой группе несколько звонков с названиями продуктов, ценами и тарифами — здесь ошибки распознавания видны лучше всего.
- Эталон людейКаждый звонок независимо оценивают два человека, свободно владеющие языком. Для смешанных звонков нужен проверяющий, знающий оба языка.
- Таблица результатовСогласие AI с эталоном записывается для каждой языковой группы и каждого критерия отдельно. Общее среднее не выводится.
Переведённый транскрипт — не доказательство
Читать оценку русскоязычного звонка на азербайджанском удобно. Но перевод добавляет ещё один слой ошибок: переводящая система может смягчить фразу, ужесточить её или изменить смысл.
- Доказательством всегда служит строка на языке оригинала; перевод — только для понимания
- В спорном решении по критическому критерию последнее слово за человеком, знающим язык оригинала
- Сильнее всего перевод искажает критерии вежливости, обещаний и запрещённых фраз
- Если комментарий на языке отчёта расходится со строкой оригинала, решает оригинал
Критерии, не зависящие от языка
Когда критерий привязан к конкретной фразе, многоязычная среда создаёт проблемы. Критерий, требующий одного определённого азербайджанского приветствия, никогда не будет выполнен в звонке на русском.
- Намерение, а не формулировка«Оператор поздоровался и представился» — на каком бы языке это ни было.
- Обязательный текст на каждом языкеГде нужна точная формулировка, например юридическое раскрытие, для каждого языка записывается утверждённый вариант.
- Критерий выбора языкаЕсли таково правило компании: «оператор перешёл на язык, на котором говорит клиент». Это отдельный и ясный критерий.
- Примеры на каждом языкеВ пояснении к критерию — по одному примеру «да» и «нет» для каждого языка.
Честное сравнение между языковыми группами
Если система ошибается в распознавании русской речи чаще, чем азербайджанской, операторы, обслуживающие русскоязычных клиентов, могут систематически получать более низкий балл. Это ошибка измерения, а не качество оператора.
- При сравнении операторов показывайте языковой состав их звонков
- Если тестовый набор выявил разницу между языками, на этом языке чаще проверяйте человеком
- Отдельно отслеживайте долю «невозможно оценить» в смешанных звонках
- Не объединяйте языковые группы в один рейтинг, пока разница не устранена
Словарь терминов
В многоязычной оценке самый полезный маленький инструмент — словарь терминов. Он помогает и находить ошибки распознавания, и писать критерии. Для каждого термина в нём есть:
- Термин и его вариантыОфициальное название тарифа, продукта или услуги и варианты, звучащие в звонках, — на азербайджанском, русском и английском.
- Типичная ошибка распознаванияКак система исказила термин в тестовом наборе. Это быстро отвечает специалисту на вопрос «что это за слово на самом деле?»
- Связь с критериемДля какого критерия термин важен — например, правильное название тарифа.
- Дата обновленияСловарь обновляется с каждым новым продуктом и кампанией; старые термины уходят в архив, а не удаляются.
Большим он быть не должен: 30–50 терминов, которые чаще всего распознаются с ошибкой, обычно покрывают основную часть проблемы.
Типичные ошибки
- Считать фразу поставщика «мы поддерживаем азербайджанский» доказательством точности
- Построить тестовый набор на одном языке и распространить результат на все языки
- Исключить из теста смешанные звонки — хотя в реальном потоке их много
- Показывать оператору переведённый транскрипт как доказательство
- Привязывать критерии к фразам на конкретном языке
Постоянный контроль
Тестовый набор — не разовая работа. Новые названия продуктов, новая кампания, новая группа операторов или изменение потока клиентов влияют на результат по языкам. Практичный ритм: каждый месяц люди заново оценивают несколько звонков из каждой языковой группы и сравнивают с результатом AI. Если согласие на одном языке падает, ищут причину: новый термин, новый диалект, качество записи. Итог записывается короткой ежемесячной заметкой: сколько звонков проверено на каждом языке, где найдено расхождение и что исправлено. Заметка помогает и при возражении оператора: если оспорено решение по русскоязычному звонку, уже известно, каким было согласие на русском в этом месяце.
Ограничения
- Точность, измеренная на одном языке, не переносится на другой язык или на языковую смесь
- В смешанных звонках и распознавание, и разделение говорящих могут ошибаться чаще
- Перевод может терять смысл и тон; основой служит строка оригинала
- Ни для одного языка нельзя без доказательств заявлять одинаковую точность
- Акцент или язык оператора — не основание для выводов о его личности или качестве
Что есть в Vexvon Audio Analyzer
- Язык речи каждого звонка определяется автоматически и показывается рядом со звонком
- Транскрипт и резюме можно перевести на выбранные языки; строка оригинала хранится отдельно
- Язык, на котором пишутся резюме и оценка, — язык отчёта — задаётся для компании, поэтому оценку звонка на русском можно читать на азербайджанском
- У каждого шага стандарта звонка доказательством служат строки транскрипта на языке оригинала
Подробнее: Vexvon Audio Analyzer. Как в целом построить тестовый набор, — в статье пилот речевой аналитики, а разделение говорящих — в статье диаризация звонков.
Первый шаг
Выгрузите языковой состав звонков за прошлый месяц: сколько на азербайджанском, русском, английском и сколько смешанных. Затем возьмите по 10 звонков из каждой группы и проверьте их по набору выше. Статья входит в раздел внедрение и надёжность аудиоанализа. Чтобы проверить подход на своих записях, свяжитесь с нами.
Продолжение темы: точность анализа звонков.