Sesten Konuşmacı Tanıma ve Ayrıştırma
GMM-UBM ve i-vector'dan speaker embedding ve diarization'a uzanan konuşmacı tanıma zinciri; eşik, kanal ve örtüşen konuşma etkileri.
Konuşmacı tanıma, ses örneklerinden konuşmacı kimliği hakkında benzerlik skoru üretir. Kimlik belirleme, doğrulama ve konuşmacı ayrıştırma farklı karar problemleridir.
Klasik yaklaşımlar
GMM-UBM sistemleri konuşmacı dağılımını evrensel arka plan modeliyle karşılaştırır. I-vector yaklaşımı konuşmayı düşük boyutlu total variability uzayında temsil eder. PLDA gibi yöntemler bu temsiller arasında skor üretir.
Öğrenilmiş temsiller
Güncel sistemler x-vector ve benzeri konuşmacı gömme vektörleri kullanır. Eğitim sırasında aynı konuşmacı örneklerinin yakın, farklı konuşmacıların uzak temsiller üretmesi hedeflenir.
Konuşmacı tanıma sonucunda elde edilen skor, seçilen eşik üzerinden kabul veya red kararına dönüştürülür. Kanal farkı, codec, kayıt süresi ve arka plan gürültüsü skor dağılımını değiştirebilir.
Konuşmacı ayrıştırma
Konuşmacı ayrıştırma, “kim ne zaman konuştu?” sorusunu yanıtlar. VAD, segment embedding'leri ve kümeleme aynı zincirde çalışır. Bilinmeyen konuşmacı sayısı ve örtüşen konuşma zorlayıcı durumlardır.
Konuşmacı skoru deterministik kimlik göstergesi değildir; eşik, kayıt koşulları ve hata oranlarıyla birlikte yorumlanır.