Skip to main content
Audio analizi

AI zəng analizinin dəqiqliyi necə ölçülür

«Sistemimiz 90% dəqiqdir» cümləsi nəyi, hansı zənglərdə və hansı dildə ölçdüyünü demirsə, faydalı məlumat deyil. Bu yazıda AI zəng analizinin dəqiqliyini dörd ayrı ölçüyə bölürük, 89% uyğunluğun həqiqi pozuntuların dörddə birinin buraxılmasını necə gizlədə bildiyini illüstrativ hesablama ilə göstəririk, etalon dəstinin qurulmasını, etibarlılıq göstəricisinin niyə ehtimal olmadığını, uyğunsuzluğun səbəb təhlilini, bir səhifəlik dəqiqlik hesabatını və dəqiqliyin davamlı izlənməsini açırıq.

29 Sentyabr 20265 dəq oxu

Qısa cavab

AI zəng analizinin dəqiqliyi bir rəqəmlə ölçülmür. Ən azı dörd şeyi ayrıca ölçmək lazımdır: transkriptin keyfiyyəti, hər meyar üzrə AI ilə insan etalonunun uyğunluğu, kritik meyarlarda səhvlərin növü — yalançı bayraq və buraxılmış pozuntu — və analiz edilə bilməyən zənglərin payı. «Sistemimiz 90% dəqiqdir» cümləsi bu dördündən hansını, hansı zənglərdə və hansı dildə ölçdüyünü demirsə, faydalı məlumat deyil.

Başqa sözlə, dəqiqlik alətin xüsusiyyəti deyil, alətin sizin zənglərinizdə, sizin meyarlarınızla göstərdiyi nəticədir. Onu yalnız öz etalon dəstiniz üzərində ölçmək olar.

Dörd ayrı ölçü

  1. Transkriptin keyfiyyətiSəs mətnə nə qədər düzgün çevrilib. Ümumi söz xətası faydalıdır, amma qiymətləndirmə üçün daha vacibi açar sözlərdir: qiymət, tarix, məhsul adı, məcburi ifadə.
  2. Meyar üzrə uyğunluqHər meyar üçün AI cavabının etalonla eyni olduğu zənglərin payı. Meyar-meyar hesablanır, çünki bir meyar yaxşı, digəri zəif işləyə bilər.
  3. Səhvlərin növüKritik meyarda iki səhv fərqli nəticə verir: yalançı bayraq operatoru haqsız yerə suçlayır, buraxılmış pozuntu isə riski gizlədir. Onlar ayrıca sayılır.
  4. Analiz edilə bilməyən zənglərSəs keyfiyyəti, dil və ya danışanların ayrılmasına görə etibarlı qiymətləndirilə bilməyən zənglərin payı. Bu zənglər uyğunluq hesabından çıxarılır və ayrıca göstərilir.

İllüstrativ nümunə: 89% uyğunluq nəyi gizlədir

Aşağıdakı rəqəmlər illüstrativ nümunədir, heç bir alətin real nəticəsi deyil. Kritik meyar: «operator məcburi açıqlamanı dedi». 108 zəngdən 8-i yazı keyfiyyətinə görə analiz edilə bilməyib; qalan 100 zəng insan etalonu ilə müqayisə olunub. Etalona görə açıqlama 80 zəngdə deyilib, 20 zəngdə deyilməyib.

  1. Açıqlama deyilən 80 zəngAI 74-ündə «deyilib», 6-sında «deyilməyib» cavabı verib. Bu 6 hal yalançı bayraqdır.
  2. Açıqlama deyilməyən 20 zəngAI 15-ində «deyilməyib», 5-ində «deyilib» cavabı verib. Bu 5 hal buraxılmış pozuntudur.
89%Ümumi uyğunluq: (74 + 15) / 100
25%Həqiqi pozuntuların buraxılan payı: 5 / 20
29%Yalançı bayraqların payı: 21 bayraqdan 6-sı

89% yaxşı görünür. Amma həqiqi pozuntuların dörddə biri tapılmayıb, qaldırılan bayraqların təxminən üçdə biri isə səhvdir. Üstəlik 108 zəngdən 8-i ümumiyyətlə qiymətləndirilməyib — əhatə 92,6%-dir. Hesabatda dörd rəqəm birlikdə göstərilməlidir, yalnız 89% yox.

Etalon dəsti necə qurulur

  • Zənglər real axını əks etdirir: müxtəlif operatorlar, zəng növləri, dillər və yazı keyfiyyəti
  • Kritik meyarlarda həm «bəli», həm də «xeyr» halları kifayət qədər olur — nadir pozuntular üçün məqsədli seçim lazım ola bilər
  • Hər zəngi iki nəfər müstəqil qiymətləndirir, fərqlər müzakirə ilə həll olunur
  • Etalon dəsti sabit saxlanılır ki, meyar və ya model dəyişəndə eyni zənglərlə müqayisə etmək olsun
  • Etalonu hazırlayanlar AI nəticəsini əvvəlcədən görmür

Etibarlılıq göstəricisi ehtimal deyil

Bir çox sistem transkript sətri və ya qərar üçün etibarlılıq göstəricisi verir. Bu faydalı siqnaldır — aşağı etibarlı sətirə daha diqqətlə baxmaq lazımdır. Amma «0,9» o demək deyil ki, belə qərarların 90%-i düzgündür. Belə oxumaq üçün göstəricinin sizin zənglərinizdə kalibrlənməsi, yəni etalonla müqayisə edilərək yoxlanması lazımdır.

Praktik yanaşma: etibarlılıq göstəricisini sıralama və seçim üçün istifadə edin, ehtimal kimi yox. Etalon dəstində aşağı etibarlı qərarlarda xətanın həqiqətən daha çox olub-olmadığını yoxlayın.

Uyğunsuzluğun səbəbini tapmaq

AI ilə etalonun fərqləndiyi hər halda səbəb bir kateqoriyaya yazılır. Bu siyahı nəyi düzəltmək lazım olduğunu göstərir:

  1. Transkript xətasıSöz səhv tanınıb və ya itib. Həll: yazı keyfiyyəti, termin lüğəti.
  2. Danışan xətasıSətir səhv tərəfə aid edilib. Həll: ayrı kanallarda yazı, diarizasiya yoxlaması.
  3. Meyarın yazılışıMeyar iki cür başa düşülə bilər. Həll: meyarı dəqiqləşdirmək, «bəli» və «xeyr» nümunələri əlavə etmək.
  4. Şərh fərqiTranskript və meyar aydındır, amma AI başqa nəticəyə gəlib. Həll: nümunələri artırmaq, həmin meyarı insan yoxlamasında saxlamaq.
  5. Etalon xətasıYenidən baxanda insanın səhv etdiyi aydın olur. Etalon düzəldilir — insan da qüsursuz deyil.

Dəqiqliyi davamlı izləmək

Bir dəfə ölçülən dəqiqlik zamanla dəyişir: yeni məhsul, yeni skript, yeni operatorlar, yeni müştəri axını. AWS-in generativ qiymətləndirmə təlimatında da qeyd olunur ki, AI qiymətləndirmələri 100% dəqiq deyil, nümunələr mütəmadi insan tərəfindən yoxlanmalı və əl ilə qiymətləndirmə prosesi dəyişmələri tutmaq üçün saxlanmalıdır.

  • Hər ay kiçik bir nümunə insan tərəfindən yenidən qiymətləndirilir
  • Meyar və ya zəng standartı dəyişəndə etalon dəsti yeni versiya ilə yenidən yoxlanılır
  • Kritik meyarlarda uyğunluq düşürsə, həmin meyar müvəqqəti olaraq insan yoxlamasına qaytarılır
  • Operatorların etirazları da siqnaldır — təsdiqlənən etirazlar hansı meyarlarda toplanır?

Bir səhifəlik dəqiqlik hesabatı

Rəhbərliyə və operatorlara göstərilən dəqiqlik məlumatı qısa, amma tam olmalıdır. Aşağıdakı quruluş illüstrativ nümunədir:

  1. KontekstHansı zəng növü, hansı dillər, hansı dövr, etalon dəstində neçə zəng, zəng standartının hansı versiyası.
  2. ƏhatəNeçə zəng analiz edilə bildi, neçəsi yox və əsas səbəblər.
  3. Meyar cədvəliHər meyar üçün uyğunluq; kritik meyarlar üçün əlavə olaraq buraxılmış pozuntu və yalançı bayraq payı.
  4. İstifadə qaydasıHansı meyarlar avtomatik nəticə kimi istifadə olunur, hansıları insan yoxlamasından keçir.
  5. Növbəti yoxlamaNə vaxt və hansı dəyişiklikdən sonra ölçmə təkrarlanacaq.

Bu hesabat operatorlarla da paylaşılanda etimad artır: onlar sistemin harada güclü, harada zəif olduğunu bilir və etirazlarını konkret meyara bağlaya bilir.

Tipik səhvlər

  • Satıcının ümumi dəqiqlik rəqəmini öz zəngləriniz üçün də keçərli saymaq
  • Yalnız ümumi uyğunluğu hesablamaq, səhv növlərini ayırmamaq
  • Analiz edilə bilməyən zəngləri sakitcə çıxarıb əhatəni göstərməmək
  • Etalonu AI nəticəsinə baxaraq hazırlamaq
  • Meyar dəyişəndən sonra köhnə dəqiqlik rəqəminə istinad etmək

Hüdudlar

  • Ölçülən dəqiqlik yalnız həmin etalon dəstinə — zəng növü, dil, yazı keyfiyyəti — aiddir
  • Nadir pozuntular üçün etibarlı rəqəm almaq çox zəng tələb edir; kiçik nümunədən çıxan faiz ehtiyatla oxunur
  • Model tərəfindən verilən etibarlılıq qiyməti kalibrlənməmiş halda ehtimal kimi təqdim edilməməlidir
  • Heç bir dəqiqlik səviyyəsi AI nəticəsini operator haqqında qərarın tək əsası etmir

Vexvon Audio Analyzer-də nə var

  • Transkriptin hər sətri tanıma etibarlılığı ilə gəlir; aşağı etibarlı sətirlər işarələnir
  • Zəng standartının hər addımı üçün status, şərh və sübut sətirləri — etalonla müqayisə və uyğunsuzluğun səbəbini tapmaq üçün lazım olan məlumat
  • Meyarları düzəldəndən sonra eyni etalon zəngləri mövcud transkript üzərindən yenidən analiz edilə bilər — nəticələri birbaşa müqayisə etmək üçün
  • Ümumi dəqiqlik faizi təqdim edilmir: dəqiqlik sizin etalon dəstinizdə ölçülməlidir

Ətraflı: Vexvon Audio Analyzer. Etalon dəstinin pilotda necə qurulduğunu pilot planı, yazı keyfiyyətinin təsirini zəif səs yazısı, dillər üzrə yoxlamanı isə çoxdilli operator qiymətləndirməsi yazısında açmışıq.

İlk addım

Bir kritik meyar seçin və 50–100 zəngdən ibarət etalon dəsti hazırlayın. AI nəticəsini onunla müqayisə edib dörd rəqəmi yazın: uyğunluq, buraxılmış pozuntular, yalançı bayraqlar və analiz edilə bilməyən zənglər. Bu yazı audio analizinin tətbiqi və etibarlılığı bölməsinə aiddir. Öz yazılarınızla sınamaq üçün bizimlə əlaqə saxlayın.

Mövzunun davamı: qiymətləndirmə kalibrasiyası.

Live demo

Ready? Let's start

See Vexvon live in a 10-minute demo.

  • A scenario built for your business
  • A live sample call
  • A tour of the platform
Get a demoorBook a meeting

Your details are used only for the demo and to get in touch.