Voice Activity Detection
Bir ses akışının hangi zaman aralıklarında konuşma içerdiğini belirleyen sınıflandırma ve segmentasyon işlemi.
Teknik Bağlam
Frame tabanlı enerji, spektral özellikler veya sinir ağı modelleri kullanılabilir. Hangover, minimum speech, gap merging ve threshold politikaları ASR segment uzunluğunu ve latency'yi doğrudan etkiler.
Sınırlar
VAD speaker identification değildir ve müzik, gürültü veya nefes gibi sesleri konuşmayla karıştırabilir; domain koşullarında kalibre edilmelidir.
İlgili Kavramlar
- Endpointing
- Automatic Speech Recognition
- Segmentation
- Signal-to-Noise Ratio