RNN-T
Streaming ASR için acoustic encoder, prediction network ve joint network ile ses ve çıktı geçmişini birlikte modelleyen transducer mimarisi.
Teknik Bağlam
CTC'ye göre çıktı token bağımlılıklarını daha doğrudan modelleyebilir ve online decoding için uygundur. Beam search state yönetimi ve blank emission latency açısından önemlidir.
Sınırlar
RNN-T adı transformer transducer türevlerini dışlamaz; prediction/joint yapısı korunurken encoder farklı mimaride olabilir.
İlgili Kavramlar
- Automatic Speech Recognition
- Streaming ASR
- Beam Search
- Connectionist Temporal Classification
Kaynak
- https://arxiv.org/abs/1211.3711