Görüntüden Örüntü ve Metin Tanıma

Görüntüden Örüntü ve Metin Tanıma

Görüntüde örüntü tanıma ve OCR zincirini özellik temsilinden dil modeliyle doğrulamaya ve karakter/kelime hata ölçümüne kadar ele alan çalışma.

Görüntüden örüntü tanıma, tekrar eden görsel yapıların sınıf veya sembol haline dönüştürülmesini kapsar. Optik karakter tanıma bu alanın en yaygın örneklerinden biridir ve görüntü işleme ile dil modellemesini aynı zincirde birleştirir.

Görsel temsil

Klasik sistemlerde görüntü normalize edilir, kenar, gradient veya doku öznitelikleri çıkarılır ve k-NN ya da SVM gibi bir sınıflandırıcıya verilir. Evrişimli ağlar bu temsil ile sınıflandırma sınırını birlikte öğrenebilir.

OCR hattı

Optik karakter tanıma belge yönü, metin bölgesi bulma, satır oluşturma, karakter veya token tanıma ve dil tabanlı çözümleme aşamalarından oluşabilir.

CTC, attention veya Transformer tabanlı yapılar görüntü özniteliklerini karakter ve alt-sözcük dizilerine dönüştürebilir. Perspektif bozulması, düşük çözünürlük, karmaşık arka plan ve sıra dışı yazı tipleri performansı doğrudan etkiler.

Dil bilgisi ve izlenebilirlik

Dil modeli görsel olarak benzer karakterler arasındaki belirsizliği azaltabilir. Bununla birlikte ham OCR tahmini ile dil modeli tarafından düzeltilmiş sonuç ayrı tutulduğunda hangi bilginin görüntüden, hangisinin dil öncülünden geldiği korunur.

Karakter hata oranı ve sözcük hata oranı genel ölçümler sağlar. Tarih, kimlik numarası veya özel ad gibi kritik alanlar ayrıca değerlendirilebilir.

Bu sayfanın QR kodu