Görüntüden Örüntü ve Metin Tanıma
Görüntüde örüntü tanıma ve OCR zincirini özellik temsilinden dil modeliyle doğrulamaya ve karakter/kelime hata ölçümüne kadar ele alan çalışma.
Görüntüden örüntü tanıma, tekrar eden görsel yapıların sınıf veya sembol haline dönüştürülmesini kapsar. Optik karakter tanıma bu alanın en yaygın örneklerinden biridir ve görüntü işleme ile dil modellemesini aynı zincirde birleştirir.
Görsel temsil
Klasik sistemlerde görüntü normalize edilir, kenar, gradient veya doku öznitelikleri çıkarılır ve k-NN ya da SVM gibi bir sınıflandırıcıya verilir. Evrişimli ağlar bu temsil ile sınıflandırma sınırını birlikte öğrenebilir.
OCR hattı
Optik karakter tanıma belge yönü, metin bölgesi bulma, satır oluşturma, karakter veya token tanıma ve dil tabanlı çözümleme aşamalarından oluşabilir.
CTC, attention veya Transformer tabanlı yapılar görüntü özniteliklerini karakter ve alt-sözcük dizilerine dönüştürebilir. Perspektif bozulması, düşük çözünürlük, karmaşık arka plan ve sıra dışı yazı tipleri performansı doğrudan etkiler.
Dil bilgisi ve izlenebilirlik
Dil modeli görsel olarak benzer karakterler arasındaki belirsizliği azaltabilir. Bununla birlikte ham OCR tahmini ile dil modeli tarafından düzeltilmiş sonuç ayrı tutulduğunda hangi bilginin görüntüden, hangisinin dil öncülünden geldiği korunur.
Karakter hata oranı ve sözcük hata oranı genel ölçümler sağlar. Tarih, kimlik numarası veya özel ad gibi kritik alanlar ayrıca değerlendirilebilir.