Automatic Speech Recognition

Türkçe karşılığı: Otomatik konuşma tanımaAlan: Konuşma İşleme

Otomatik konuşma tanıma (Automatic Speech Recognition) — Ses sinyalindeki konuşmayı zaman sıralı metne veya token dizisine dönüştüren otomatik konuşma işleme sistemi.

Teknik Bağlam

Güncel ASR sistemlerinde akustik ön işleme; encoder-decoder, CTC veya RNN-T benzeri modelleme; çözümleme ve dilsel normalizasyon aşamaları birlikte bulunabilir. Üretim ortamında yalnız WER değil, RTF, segmentasyon, zaman damgalarının doğruluğu ve hata sonrasında işlemenin nasıl sürdürüldüğü de sistem davranışını belirler.

Kavramsal Sınır

ASR ile konuşmacı günlükleme aynı görev değildir. ASR ne söylendiğini metne dönüştürür; konuşmacı günlükleme ise kimin hangi zaman aralığında konuştuğunu belirlemeye çalışır.

İlgili Kavramlar

İlgili makale: Sesten Konuşma Tanıma

İlgili teknik yayınlar

Başlık veya özetinde bu kavrama doğrudan karşılık gelen yayınlar.

ASR Sistemlerinde Kuyruk Kararlılığı

ASR kapasitesini tek başına RTF açıklamaz; geliş hızı, segment süresi, servis süresi dağılımı, batch ve heterojen çalışanlar birlikte kuyruğun kararlı kalıp kalmayacağını belirler.

Sesten Konuşma Tanıma

Ayrışık sözcük, sözcük yakalama ve sürekli konuşmadan DTW, HMM/WFST ve n-gram tabanlı klasik sistemlere; CTC, RNN-T, Transformer ve Conformer yaklaşımlarına uzanan ASR notu.