Konuşma Sesi Ayrıştırma Sistemi (Danışman: Doç. Dr. Güray Sonugür)
Afyon Kocatepe Üniversitesi Mekatronik Mühendisliği (Lisans) bitirme projesi kapsamında hazırladığım "DSP, FFT ve Makine Öğrenmesi Tabanlı Konuşma Sesi Ayrıştırma ve Filtreleme Sistemi" başlıklı proje
Amaç ve Problem
Konuşmacı tanıma süreçlerindeki doğruluk adli bilişim alanında önemli bir yere sahiptir. Bu çalışmada, konuşma sesi kayıtlarının gerçek zamanlı olarak iyileştirilmesiyle söz konusu doğruluğun artırılması hedeflenmiştir. Bu kapsamda iki tür ses iyileştirme katmanı gerçeklenmiştir.
Kullanılan Yöntemler
DSP ve FFT Tabanlı Filtreleme
İlk katmanda sesteki gürültüler DSP (Sayısal Sinyal İşleme) teknikleri ve FFT (Hızlı Fourier Dönüşümü) kullanılarak zaman-frekans alanında filtrelenmiştir.
Yapay Sinir Ağı Tabanlı Ayrıştırma
Sonraki katmanda konuşma sesinin ANN (Yapay Sinir Ağları) kullanılarak diğer çevresel seslerden ayrıştırılması sağlanmıştır.
Gerçekleme
Yazılım C++ programlama dili ve nesne yönelimli programlama yaklaşımıyla gerçeklenmiştir. Örnek ses kayıtlarında yüksek doğrulukla iyileştirme sağlandığı görülmüştür.
Konuşmacı Tanıma ve Testler
MFCC ve GMM
Sonraki süreçte bu filtrenin kullanıldığı MFCC (Mel Frekansı Kepstrum Katsayıları) ve GMM (Gauss Karışım Modeli) tabanlı konuşmacı tanıma yazılımı gerçeklenmiştir.
VoxCeleb Değerlendirmesi
Yazılım, büyük ölçekli VoxCeleb konuşma kayıtları veri kümesiyle test edilmiştir. Sonuçlar, gürültü içeren ses kayıtlarında konuşmacı tanıma doğruluğunun arttığını ve temiz ses kayıtlarında kayıp oluşmadığını göstermiştir.