Taranmış PDF neden aranamaz?
Tarayıcı, sayfayı piksellerden oluşan bir görüntü olarak kaydeder. Arama motoru ya da doküman yönetim sistemi bu dosyada arama yaptığında aranacak bir metin katmanı bulamaz. OCR, görüntüyü işleyip metin katmanını üretir ve dosyaya ekler.
Sonucu belirleyen şey: tarama kalitesi
OCR başarımı büyük ölçüde girdiye bağlıdır. Pratikte en çok fark yaratan noktalar:
- Çözünürlük — metin belgeleri için 300 dpi yaygın bir alt sınırdır
- Düz tarama — eğri sayfalar tanıma oranını düşürür
- Kontrast — soluk fotokopiler ve renkli zeminler zorlar
- El yazısı — matbu metne göre belirgin biçimde daha düşük doğrulukla tanınır
OCR sonrası ne mümkün olur?
Metin katmanı oluştuğunda arşiv gerçekten kullanılabilir hâle gelir: içerikte tam metin arama, belgeler arası karşılaştırma, otomatik sınıflandırma önerileri ve yapay zekâ katmanının bu belgelere de cevap üretebilmesi.
mindfile tarafında
Yüklenen görüntü tabanlı belgeler işlem hattında OCR sürecinden geçirilir; sonrasında arama ve yapay zekâ katmanları bu içerik üzerinde çalışır. Böylece 1990'lardan kalma taranmış bir dosya da, dünkü sözleşme kadar sorgulanabilir olur.
SIKÇA SORULAN SORULAR
OCR her belgeyi %100 doğru okur mu?
Hayır. Matbu ve temiz taranmış metinlerde doğruluk çok yüksektir; el yazısı, soluk fotokopi ve karmaşık tablolarda hata payı artar. Bu yüzden kritik belgelerde asıl nüsha her zaman referans kalır.
OCR sonrası belgenin aslı değişir mi?
Hayır. OCR görüntünün üzerine bir metin katmanı ekler; sayfanın görüntüsü ve belgenin aslı olduğu gibi korunur.