Sesten Konuşma Tanıma
Klasik HMM/WFST mimarisinden CTC, RNN-T, Transformer ve Conformer yaklaşımlarına; WER, alan uyumu ve gerçek zaman gereksinimleriyle ASR.
Konuşma tanıma, akustik işareti sözcük, alt-sözcük veya karakter dizisine dönüştürür. Problem akustik temsil, zaman hizalama, dil bilgisi ve arama bileşenlerini bir araya getirir.
Klasik mimariler
Geleneksel sistemlerde MFCC benzeri öznitelikler, akustik model, HMM durumları, telaffuz sözlüğü ve n-gram dil modeli birlikte kullanılır. WFST tabanlı çözümleme bu bileşenleri tek arama grafiğinde birleştirebilir.
Uçtan uca modeller
Konuşma tanıma sistemlerinde CTC kare-seviye hizalama gereksinimini azaltır. RNN-T akışkan çözümleme için uygundur. Transformer ve Conformer yapıları uzun bağlamı etkili biçimde modelleyebilir.
Uçtan uca mimari, VAD, yeniden örnekleme, kanal yönetimi ve segmentasyon gereksinimini ortadan kaldırmaz. Bu katmanlar model girdisinin yapısını belirler.
Alan uyumu
Teknik terimler, kişi adları ve kuruma özgü kelimeler genel dil modelinde zayıf temsil edilebilir. Contextual biasing, rescoring ve alan uyarlama bu tür söz varlığını güçlendirebilir.
WER temel hata ölçüsüdür. Sayılar, özel adlar ve kritik terimler ayrıca değerlendirildiğinde sistemin gerçek kullanım başarımı daha iyi görülür.
Gerçek zaman sistemlerinde WER yanında gerçek zaman faktörü, segment gecikmesi, zaman damgası doğruluğu ve sonuç kararlılığı da izlenir.