Elinizde taranmış bir sözleşme, eski bir tapu fotokopisi ya da bir kitabın birkaç sayfası var. PDF'i açıyorsunuz, ama bir kelimeyi aradığınızda hiçbir sonuç çıkmıyor; metni seçmeye çalıştığınızda sayfanın tamamı resim gibi işaretleniyor. Nedeni basit: Taranmış bir PDF'in sayfaları aslında birer fotoğraftır. Bilgisayar orada harf değil, piksel görür.
Bu yazıda sorunun gerçekten tarama kaynaklı olup olmadığını nasıl anlayacağınızı, metin tanıma (OCR) öncesinde taramayı nasıl iyileştireceğinizi ve tanınan metni hangi adımlarla kontrol edeceğinizi anlatıyoruz.
30 saniyelik test: Belgeniz taranmış mı?
- PDF'i açın ve bir kelimeyi fareyle seçmeye çalışın ya da Ctrl+F ile (telefonda “Sayfada bul”) arayın.
- Metin seçiliyor ve arama sonuç veriyorsa belgeniz metin tabanlıdır; OCR'a ihtiyacınız yoktur. Metni almak için doğrudan PDF'i metne (TXT) çevirme ya da PDF'i Word'e çevirme aracını kullanın. Bu yol daha hızlıdır ve harf tanıma hatası içermez.
- Metin seçilmiyor, sayfa bir bütün olarak işaretleniyorsa belgeniz taranmıştır. Metni aranabilir yapmak için OCR gerekir.
Karma belgelere dikkat: Bazı PDF'lerde sayfaların bir kısmı metin tabanlı, bir kısmı taranmıştır. Testi birkaç farklı sayfada tekrarlayın. OCR tüm sayfaları görüntüden yeniden oluşturduğu için, metin tabanlı sayfalarda da orijinal metnin yerini tanınan metin alır. Böyle bir belgede yalnızca taranmış sayfaları ayırıp işlemek daha temiz sonuç verir.
OCR kısaca ne yapar?
OCR (Optik Karakter Tanıma), görüntüdeki harfleri tanıyıp bilgisayarın okuyabileceği metne dönüştürür. PDF OCR aracı her sayfayı 300 DPI çözünürlükte işler, seçtiğiniz dildeki metni (Türkçe, İngilizce, Almanca, İspanyolca veya İtalyanca) tanır ve size aranabilir bir PDF verir. Sayfaların görünümü değişmez; tanınan metin, sayfanın arkasına görünmez bir katman olarak eklenir. Böylece Ctrl+F ile arama yapabilir, metni seçip kopyalayabilirsiniz.
Tanıma kalitesi taramada belirlenir
Tanıma hatalarının çoğu aracın değil, görüntünün sorunudur. OCR'dan önce taramayı düzeltmek, sonradan hata ayıklamaktan çok daha kolaydır.
Tarayıcı cihazıyla:
- Çözünürlüğü en az 300 DPI yapın. Düşük çözünürlükte küçük harfler birbirine karışır.
- Yalnızca metin içeren belgelerde gri tonlama yeterlidir.
- Sayfayı camın kenarına yaslayarak düz yerleştirin.
Telefonla:
- Belgeyi düz bir zemine koyun, iyi ışıkta ve tam karşıdan çekin. Açılı çekimde satırlar eğrilir.
- Telefonunuzun gölgesinin sayfaya düşmemesine dikkat edin; parlak kâğıtta flaş yansıma yapabilir.
- Fotoğrafları JPG'yi PDF'e çevirme aracıyla tek PDF'te toplayın, sonra OCR uygulayın. Telefonun kaydettiği yön bilgisi okunduğu için dik çektiğiniz sayfalar yan dönük olmaz.
Doğru iş sırası
- Gereken sayfaları ayırın. Uzun bir taramanın yalnızca birkaç bölümüne ihtiyacınız varsa PDF bölme aracıyla sayfaları ayırıp PDF birleştirme ile tek dosyada toplayın. Her sayfa ayrı tarandığı için işlem süresi sayfa sayısıyla artar; kısa dosya hem daha çabuk biter hem de 25 MB sınırına takılmaz.
- OCR uygulayın. Dosyayı yükleyip Metni Tanı düğmesine basın ve aranabilir PDF'i indirin.
- Sonucu kontrol edin. Belgede birkaç kelime arayın, özellikle sayıları ve özel isimleri aşağıdaki tabloya göre gözden geçirin.
- Büyük çıktıyı sıkıştırabilirsiniz. OCR çıktısının orijinalden büyük olması normaldir; PDF sıkıştırma aracı yalnızca görselleri küçültür ve OCR ile eklenen metin katmanını korur.
Tanınan metni nereye taşıyacaksınız?
- Birkaç satırı başka bir yere yapıştırmak: Aranabilir PDF'ten doğrudan seçip kopyalayın.
- Tüm metni tek dosyada almak: OCR uygulanmış PDF'i PDF'i metne çevirme aracına yükleyin. Her sayfanın “=== Sayfa 1 ===” gibi bir ayraçla ayrıldığı, UTF-8 kodlu bir TXT dosyası alırsınız; Türkçe karakterler korunur.
- Word'de düzenlemek: Metni kopyalayıp Word'e yapıştırabilir ya da TXT olarak dışa aktarabilirsiniz. Taranmış sayfanın kendisi görüntü olduğu için, orijinal biçimlendirmeyi birebir koruyan bir Word belgesi elde edilemeyebilir.
- Tablolar: Taranmış tablolardaki veriler OCR'dan sonra çoğunlukla metin satırları olarak gelir; PDF'i Excel'e çevirme aracında tablo yapısı tam korunmayabilir. Kritik rakamları elle kontrol edin.
Sonucu kontrol edin: Sık karışan karakterler
OCR basılı metinde başarılıdır ama kusursuz değildir. Özellikle şu karakterlere dikkat edin:
| Karışabilen | Neden önemli |
|---|---|
| 0 (sıfır) ve O | IBAN, telefon ve fatura numaraları |
| 1, l (küçük L) ve I | TC kimlik numarası, tarihler |
| ı ve i, İ ve I | Türkçe kelimelerin anlamı değişebilir |
| rn ve m | “kurnaz” kelimesi “kumaz” olarak okunabilir |
| virgül ve nokta | Tutarlar ve ondalık sayılar |
Tanınan metni resmî bir yazıya, sözleşmeye ya da muhasebe kaydına aktarıyorsanız sayıları ve özel isimleri orijinal görüntüyle karşılaştırın. Bu küçük kontrol, sonradan fark edilmesi zor hataları önler.
OCR'ın sınırları
- El yazısı: OCR basılı metin için tasarlanmıştır; el yazısında başarı, yazının okunaklılığına göre büyük ölçüde değişir.
- Diller: Tanıma Türkçe, İngilizce, Almanca, İspanyolca ve İtalyanca için yapılır. Arapça, Kiril gibi farklı alfabelerle yazılmış belgelerde sonuç düşük olur.
- Süre: Her sayfa ayrı ayrı işlendiği için çok sayfalı belgelerde işlem birkaç dakika sürebilir.
Gizlilik
Taranmış belgeler çoğu zaman kişisel bilgi içerir. Dosyalar HTTPS ile yüklenir ve işlem bittikten yaklaşık 10 dakika sonra sunucudan otomatik olarak silinir. Üyelik gerekmez. Çok hassas belgelerde (sağlık raporu, kimlik) yalnızca ihtiyacınız olan sayfaları işlemek iyi bir alışkanlıktır.
Sıkça sorulan sorular
OCR'dan sonra aradığım kelimeyi hâlâ bulamıyorum. Neden?
Kelime tanıma sırasında farklı okunmuş olabilir; örneğin “ı” yerine “i” ya da “m” yerine “rn”. Kelimenin bir kısmıyla ya da Türkçe karakter içermeyen bir biçimiyle arayın. Sorun sık tekrarlanıyorsa taramayı daha yüksek çözünürlükte ve daha iyi ışıkta yenileyin.
OCR uygulanmış dosyam neden büyüdü?
Sayfalar yüksek çözünürlükte yeniden oluşturulduğu için çıktı orijinalden büyük olabilir. Bu normaldir. Dosyayı sıkıştırırsanız eklenen metin katmanı kaybolacağı için bu yola başvurmayın.
Taranmış PDF'i doğrudan Word'e çevirirsem ne olur?
Sayfalar Word'e resim olarak aktarılır ve metin düzenlenemez. Önce OCR uygulayın, ardından metni kopyalayın veya TXT olarak dışa aktarın.
Türkçe karakterler tanınıyor mu?
Evet. “Belgenin dili” olarak Türkçe seçildiğinde (Türkçe sayfada varsayılan budur) ç, ğ, ı, İ, ö, ş ve ü desteklenir. Yine de önemli belgelerde ı/i gibi harfleri kontrol etmenizi öneririz.
Taranmış belgenizi aranabilir yapın
Testi yaptınız ve belgeniz taranmış çıktıysa PDF OCR aracını açın; dosyanızı yükleyin, “Metni Tanı”ya basın ve içinde arama yapılabilen PDF'inizi indirin.

