Konuşma Sesi Ayrıştırma Sistemi (Danışman: Doç. Dr. Güray Sonugür)
Afyon Kocatepe Üniversitesi Mekatronik Mühendisliği bitirme projem: DSP/FFT tabanlı ses iyileştirme, yapay sinir ağıyla konuşma ayrıştırma ve MFCC/GMM konuşmacı tanıma değerlendirmesini birleştiren C++ sistemi.
Bu çalışma, Afyon Kocatepe Üniversitesi Mekatronik Mühendisliği lisans bitirme projem kapsamında geliştirdiğim DSP, FFT ve Makine Öğrenmesi Tabanlı Konuşma Sesi Ayrıştırma ve Filtreleme Sistemidir.
Temel problem, gürültülü konuşma kaydını yalnız insan kulağına daha temiz duyurmak değil, sonraki konuşmacı tanıma aşamasında kullanılabilir bilgiyi koruyarak iyileştirmekti.
DSP ve FFT Tabanlı Filtreleme
İlk katmanda ses sinyalini zaman ve frekans açısından incelemek için sayısal sinyal işleme yöntemleri ile Hızlı Fourier Dönüşümü kullandım.
Frekans alanındaki bileşenleri incelemek, konuşma bandı ile çevresel gürültünün belirli örneklerdeki dağılımını gözlemlemeye ve filtreleme kararlarını buna göre uygulamaya imkân veriyordu.
Burada önemli sınır, gürültüyü azaltırken konuşmacı kimliğini taşıyan spektral bilgiyi de aşırı bastırmamaktı. İnsan kulağına daha "temiz" gelen sinyalin biyometrik özellik çıkarımı için otomatik olarak daha iyi olduğunu varsaymadım.
Yapay Sinir Ağıyla Ayrıştırma
İkinci katmanda konuşma ile çevresel seslerin ayrımında yapay sinir ağı tabanlı bir yaklaşım kullandım. Bu bölüm, sabit filtre kurallarının ötesinde veri üzerinden öğrenilen karar davranışını sinyal işleme zincirine dahil ediyordu.
Bugünkü modelleri geriye dönük olarak bu projeye atfetmiyorum. Çalışma, dönemin yapay sinir ağı yaklaşımı ve kendi C++ gerçeklemem çerçevesindeydi.
C++ Gerçekleme
Sistem C++ ve nesne yönelimli programlama yaklaşımıyla gerçeklendi. Ses alma/okuma, dönüşüm, filtreleme, ayrıştırma ve sonraki değerlendirme adımlarını birbirinden ayrılabilir bileşenler olarak ele almaya çalıştım.
Gerçek zaman gereksinimi, algoritmanın yalnız doğru çıktı üretmesini değil, işleme maliyetinin ses akışına yetişebilmesini de gerekli kılıyordu.
MFCC ve GMM ile Konuşmacı Tanıma
Filtreleme sonucunun yalnız waveform veya dinleme testiyle değerlendirilmesi yeterli değildi. Sonraki aşamada MFCC özellikleri ve GMM tabanlı konuşmacı tanıma yazılımı geliştirerek iyileştirmenin tanıma performansına etkisini inceledim.
Bu zincir:
ses -> iyileştirme/ayrıştırma -> MFCC -> GMM -> konuşmacı kararışeklinde değerlendirildi.
VoxCeleb Üzerindeki Değerlendirme
Proje kayıtlarında sistemin VoxCeleb konuşma verileriyle sınandığı; gürültülü örneklerde konuşmacı tanıma sonucunun iyileştiği ve temiz örneklerde kayıp gözlenmediği belirtilmiştir.
Kamuya açık bu sayfada deneyin tam split, gürültü modeli ve sayısal metrik tablosu bulunmadığı için bu sonucu yeni bir yüzde veya benchmark iddiasına dönüştürmüyorum. Tarihsel çalışmanın desteklediği ifade, filtreli ve filtresiz tanıma akışlarının karşılaştırılmış olmasıdır.
Sonraki Çalışmalarla Bağlantı
Bu proje, daha sonraki konuşma tanıma, konuşmacı tanıma ve gerçek zamanlı ses işleme çalışmalarımın erken mühendislik temelidir. Bugünkü sistemlerde VAD, konuşmacı gömme vektörleri, segmentasyon ve kapasite mühendisliğini çok daha farklı model ve runtime'larla ele alıyorum.
Bitirme projesinin danışmanı Doç. Dr. Güray Sonugür'dür.