Konuşma Tanıma Sistemlerinde Whisper Mimarisi

Konuşma Tanıma Sistemlerinde Whisper Mimarisi

Whisper mimarisini log-Mel girişi, encoder-decoder Transformer yapısı, token üretimi, zaman damgaları ve çok dilli konuşma tanıma açısından inceler. Model özellikleri üretim hattındaki gecikme ve doğruluk sınırlarıyla birlikte değerlendirilir.

Otomatik konuşma tanıma (ASR) sistemlerinde geleneksel olarak kullanılan gizli Markov modelleri (HMM) ve derin sinir ağları (DNN) tabanlı hibrit mimariler, yerini yüksek ölçekli uçtan uca (end-to-end) transformatör (transformer) ağlarına bırakmaktadır,,. OpenAI Whisper, akustik sinyallerin ara gösterimlere ihtiyaç duyulmadan doğrudan metne dönüştürülmesini sağlayan, kodlayıcı-kod çözücü (encoder-decoder) tabanlı bir transformatör modelidir. Model, giriş olarak aldığı ham ses sinyallerini 30 saniyelik pencerelere böler ve bu pencereleri log-Mel spektrogramlarına dönüştürerek işler. Bu dönüşüm süreci, ses sinyallerinin frekans alanındaki güç spektrumunun Mel filtre bankalarından geçirilerek frekansların Mel sepetlerine (bins) gruplanması ve ardından bu değerlerin logaritmasının alınmasıyla elde edilir. Elde edilen log-Mel spektrogramları, sinyalin dinamik aralığını sıkıştırarak transformatör kodlayıcısı için uygun tensör temsilleri oluşturur.

Bağlantıcı zamansal sınıflandırma (connectionist temporal classification - CTC) algoritmaları ile transformatörlerin entegrasyonu, hizalanmamış konuşma verilerindeki bulanık ses-sembol geçişlerinin doğrudan çözümlenmesini sağlar,. CTC tabanlı bir yaklaşım, zaman adımları boyunca gizli durum geçişlerini modelleyerek olası tüm etiket dizilimleri üzerinde olasılık dağılımları hesaplar ve ardından hedef diziyi optimize eder. Ancak CTC modellerinin yetersiz kaldığı uzun mesafe dil bağımlılıkları, transformatörlerin çok başlıklı öz-dikkat (multiheaded self-attention) mekanizmaları sayesinde çözülmektedir-. Whisper mimarisinde kodlayıcı, ses pencerelerini işlerken, kod çözücü önceki metin belirteçlerini ve kodlayıcıdan gelen gizli durumları kullanarak otoregresif bir biçimde (autoregressively) hedef diziyi adım adım üretir,.

Zayıf Gözetim ve Yarı Denetimli Öğrenme Modelleri

Derin öğrenme modellerinde yüksek doğruluk elde etmek genellikle büyük ölçekli ve titizlikle hizalanmış etiketli veri kümelerine dayanır; ancak Whisper, sezgisel etiketleme stratejilerini kullanan zayıf gözetim (weak supervision) paradigmasıyla eğitilmiştir,. Modelin son yinelemelerinden olan large-v3 sürümü, 1 milyon saatlik zayıf etiketli ses verisi ve büyük ölçüde büyük-v2 (large-v2) sürümü üzerinden elde edilmiş 4 milyon saatlik sözde etiketli (pseudo-labeled) veri kullanılarak optimize edilmiştir,. Sözde etiketleme işlemi, önceden eğitilmiş temel bir modelin etiketlenmemiş veri setleri üzerinde tahminler üretmesi ve bu tahminlerin yeni etiketler olarak modele geri beslenmesi mantığıyla işler,,.

Veri kümelerindeki kaçınılmaz gürültüyü yönetmek için stokastik derinlik (stochastic depth) ve bırakma (dropout) gibi düzenlileştirme teknikleri mimariye entegre edilmiştir. Stokastik derinlik, eğitim sırasında ağdaki belirli blokların rastgele atlanmasını sağlayarak modelin spesifik nöronlara ve gürültülü etiketlere aşırı uyum sağlamasını (overfitting) engeller,. Aynı zamanda, aralıklı (intermediate) öz denetimli (self-supervised) ön eğitim adımları modelin ses rekonstrüksiyon yeteneklerini güçlendirir ve etiketlere dayalı ince ayar (fine-tuning) öncesinde genel dil gösterimlerinin oturmasını sağlar. Çok görevli eğitim (multitask training) yaklaşımı, aynı ağ yapısının çeviri, diller arası konuşma tanıma ve konuşma etkinliği tespiti (voice activity detection - VAD) gibi farklı işlemleri paralel yürütmesine olanak tanır,. Belirli dillere ait eğitim verisi bulunmayan koşullarda dahi modelin başarılı transkripsiyon yapabilmesi, veri havuzundaki genelleştirilmiş dil yapılarından faydalanan sıfır-atışlı (zero-shot) transfer öğrenme mekanizmasıyla mümkün olmaktadır,.

Akustik modellemeyi takiben yürütülen kod çözme (decoding) aşaması, modelin tahmin ettiği akustik birimlerin geçerli sözcüksel veya fonetik dizilere dönüştürüldüğü arama işlemini tanımlar. Whisper, uçsuz bucaksız olasılık uzayında arama maliyetini düşürmek için dinamik ışın araması (beam search) algoritmasından yararlanır,. Bu yöntem, yalnızca en yüksek olasılıklı belirli sayıdaki (beam width) tahmin dizisini aktif tutarak düşük olasılıklı dalları budar. Algoritmanın doğruluk oranı, beam_size parametresinin artırılmasıyla yükseltilebilir; ancak bu durum donanım üzerindeki hesaplama yükünü artırdığından işlem hızını negatif yönde etkiler,.

Kod çözme sırasında deterministik çıktı ile stokastik çeşitlilik arasındaki denge temperature (sıcaklık) parametresiyle ayarlanır,. Whisper modelinin uyguladığı dinamik sıcaklık ölçeklendirmesinde, süreç varsayılan olarak sıcaklık 0'da (tamamen açgözlü kod çözme) başlar,. Eğer modelin ürettiği belirteçlerin ortalama logaritma olasılıkları belirlenen güven eşiğinin altındaysa veya üretilen dizi içindeki gzip sıkıştırma oranı anomali düzeyinde yüksekse (örneğin tekrar eden hece döngüleri), model sıcaklığı otomatik olarak 1.0'a kadar 0.2'lik adımlarla artırarak yeni diziler örnekler. Bu geriye dönük arama-hata düzeltme yeteneği, hibrit akustik-dil modellerinde olduğu gibi deterministik kuralların ötesine geçerek istatistiksel belirsizlikleri yönetir,.

Ağ Kuantizasyonu ve OpenVINO ile Donanım Hızlandırma

Whisper modelinin 500 milyon ile 1.5 milyar arası parametre içeren geniş sürümleri (örneğin large-v2 veya large-v3), kısıtlı belleğe ve düşük hesaplama kapasitesine sahip kenar sunucularda (edge servers) veya mobil platformlarda ciddi gecikme (latency) sorunları yaratır,,. Bu bağlamda kuantizasyon (quantization), 32-bit kayan noktalı (FP32) ağ ağırlıklarının 16-bit (FP16/INT16) veya 8-bit tamsayı (INT8) formatlarına sıkıştırıldığı bir sinir ağı optimizasyon tekniğidir,,. Ağırlıkların yalnızca kesilmesi (truncation) yerine yeniden kalibre edilerek yuvarlanması prensibine dayanan INT8 kuantizasyonu, bellek ayak izini dörtte bir oranında azaltırken doğruluk oranındaki kayıpları asgari düzeyde tutar.

Optimizasyon amacıyla CTranslate2 kütüphanesi veya Intel'in Açık Görsel Çıkarım ve Sinir Ağı Optimizasyonu (Open Visual Inference and Neural Network Optimization - OpenVINO) çerçevesi sıkça kullanılmaktadır,. OpenVINO kullanılarak yapılan bir dağıtımda Whisper modeli, sabit boyutlu tensörler için optimize edilmiş bir Ara Temsil (Intermediate Representation - IR) formatına derlenir,. NNCF (Neural Network Compression Framework) aracı vasıtasıyla kodlayıcı ve otoregresif kod çözücü modülleri Eğitim Sonrası Kuantizasyon (Post-Training Quantization - PTQ) sürecinden geçirilerek ağırlıklar INT8 formatına uyarlanır,,. Çıkarım süresinde çok düşük bir etkiye sahip olduğu için kod çözücünün ilk adımı (first-step-decoder) genellikle kuantize edilmeden bırakılır. Whisper'ın, Distil-Whisper gibi bilgi damıtma (knowledge distillation) tabanlı varyantlarına uygulanan kuantizasyon, CPU tabanlı donanımlarda standart işleyişe kıyasla üç kata varan çıkarım hızlanmaları sağlar,.

Sistem Mühendisliği: Konuşmacı Günlükleme (Diarization)

Sistem tasarımı perspektifinde Whisper, gelişmiş bir konuşma tanıyıcı olmasına rağmen, sesi belirli bir konuşmacı kimliğine atayan konuşmacı günlükleme (speaker diarization) görevini yerel olarak desteklemez,. Gerçek dünyadaki birden çok konuşmacılı senaryolarda, örtüşen konuşmalar (overlapping speech) veya mikrofon değişim noktalarına çok yakın ses parçaları, ASR sistemlerinde hizalama zorluklarına yol açar,. Diarization yeteneği kazandırmak için Whisper, Pyannote veya NVIDIA NeMo gibi ek yapılarla aynı veri hattı (pipeline) üzerinde birleştirilir,.

Hizalama ardışık düzeni, öncelikle Demucs gibi kaynak ayırma (source separation) modelleriyle vokal bileşenin arka plandaki gürültü veya müzikten arındırılmasıyla başlar. Ses dosyasının Whisper ile metne dönüştürülmesinin ardından Wav2Vec2 modeli kullanılarak zorunlu hizalama (forced alignment) işlemi gerçekleştirilir ve metindeki her kelimenin kesin zaman damgası çıkarılır,. Konuşmacı ayrımı aşamasında NVIDIA NeMo'nun Çok Ölçekli Günlükleme Kod Çözücüsü (Multiscale Diarization Decoder - MSDD) devreye girer. Bu mimari, konuşmacı gömülü temsillere (speaker embeddings) farklı geçici çözünürlüklerden (temporal resolutions) bakarak ses profillerini kümelendirir,. Transkripsiyondaki bazı sınır belirsizliklerini çözmek için bir noktalama modeli (örneğin kredor/punctuate-all) çıktıları analiz eder ve noktalama işaretlerini yeniden oluşturarak aynı cümle içindeki kelimeleri tutarlı bir konuşmacıya yeniden atar (realigned). Bu birleşik boru hattı, makine dinlemesinde konuşmacıların kimliklerini yüksek kesinlikle yalıtarak çok yönlü analiz yeteneklerini artırır.

Yapay zeka sistemlerindeki bu gelişim vektörü, salt akustik tanıma işlevini diller arası esnekliğe, kuantize edilmiş düşük güçlü kenar cihaz dağıtımına ve bağlam bilinçli sese dönüştürmektedir,. Modellerin zayıf gözetim altında eğitilmiş devasa parametre alanları, ara metin temsillerine dayanmayan metinsiz doğal dil işleme (textless NLP) mimarilerinin zeminini hazırlayarak uçtan uca etkileşim paradigmalarının ölçeklendirilmesini sağlamaktadır,.

Bu sayfanın QR kodu