Turkish Finite-State Syllabifier
Türkçe sözcükleri ünlü/ünsüz örüntüsüne indirgeyip 20 durumlu tablo güdümlü bir sonlu durumlu dönüştürücüyle doğrusal zamanda heceleyen C# araştırma yazılımı.
Bu repository benim için bir yardımcı sınıftan çok, sonlu durumlu bir modelin doğrudan çalıştırılabilir hale getirilmesi örneği. Sözcük önce iki sembollü bir alfabeye indirgeniyor: ünlüler A, ünsüzler B. Ardından 20 durumlu tablo güdümlü model input'u soldan sağa tüketirken yalnız bir sonraki durumu seçmiyor; gerektiğinde orijinal sözcükten hangi parçanın hece olarak çıkarılacağını da belirliyor.
Bu nedenle yapı salt bir DFA olarak düşünülmemeli. Geçiş sırasında çıktı ürettiği için sonlu durumlu dönüştürücü tanımı daha açıklayıcıdır. Backtracking, sözlük veya regex motoru yoktur; çalışma süresi sözcük uzunluğuyla doğrusal, otomata durumu ise sabit boyuttadır. Modelin sınırı da buradadır: genel amaçlı biçimbilim çözümleyicisi değildir ve Türkçedeki bütün özel/yabancı yazım durumlarını kapsadığı iddia edilmez.
Fonetik aday üretme problemi hecelemeden ayrıdır. İsimleri yaklaşık ses benzerliğiyle gruplamak için Turkish Numeric Soundex projesi farklı bir yaklaşım kullanır.
Modelin ayrıntıları: Sonlu Durumlu Türkçe Heceleme Algoritması GitHub: GitHub Zenodo: Zenodo DOI: DOI