Automatic Speech Recognition
Ses sinyalindeki konuşmayı zaman sıralı metin veya token dizisine dönüştüren makine öğrenmesi sistemi.
Teknik Bağlam
Modern ASR acoustic/front-end işleme, encoder-decoder veya CTC/RNN-T benzeri modelleme, decoding ve dilsel normalizasyon aşamalarını içerebilir. Production tasarımında WER kadar RTF, segmentasyon, timestamp ve failure recovery önemlidir.
Sınırlar
ASR ile speaker diarization aynı görev değildir; biri ne söylendiğini, diğeri kimin ne zaman konuştuğunu modellemeye çalışır.
İlgili Kavramlar
- Word Error Rate
- Voice Activity Detection
- Speaker Diarization
- Real-Time Factor