
Kitap sayfalarının fotoğraflarında OCR neden başarısız oluyor (ve birkaç derecelik bir eğim doğruluğu nasıl mahvediyor)
Yayın Tarihi 24 Tem 2026
Daha önce hiçbir kitap sayfasının fotoğrafını çevrimiçi olarak metne dönüştürmeye çalışıp, karşınıza anlamsız ve bozuk bir metin yığını çıkmışsa, muhtemelen yanlış şeyi suçlamışsınızdır. Eski, sararmış kağıt veya kötü aydınlatmanın suçlu olduğunu varsaymak cazip gelebilir — ancak testlerde, bunların hiçbirinin sonuç üzerinde önemli bir etkisi olmadı. Asıl neden, neredeyse her zaman fotoğrafa bakarak göremeyeceğiniz bir şeydir: kameranın hafifçe eğik olması.
Test: aynı sayfa, dört koşul
Gerçek hayattaki kitap fotoğraflarında OCR’yi (optik karakter tanıma) aslında neyin bozduğunu bulmak için, aynı metin bloğunu açık kaynaklı OCR motoru olan Tesseract’ta dört farklı koşul altında işledik: net ve düz bir tarama, sararmış/solmuş bir sayfa, yaklaşık 12 derece eğik bir fotoğraf ve parlama efekti eklenmiş eğik bir fotoğraf.
| Koşul | Kelime doğruluğu |
|---|---|
| Temiz, düz tarama | %100 |
| Sararmış, solmuş sayfa (eğiklik yok) | %100 |
| Yaklaşık 12° eğik (renk solması yok) | %67,7 |
| Yaklaşık 8° eğik + parlama | %71,0 |
Sararmış sayfa, kusursuz olanla aynı puanı aldı — tam puan. Eğim eklendiği anda doğruluk oranı üçte bir oranında düştü ve “ders kitabını Word’e tara” araçlarını denemiş olan herkesin gördüğü türden bir çıktı ortaya çıktı: “brown” yerine "brow,", “Chapter.” yerine "Chapte,.", “hidden” yerine "hidde,,".
Neden küçük bir eğim bu kadar büyük bir hasara yol açar?
OCR motorları, metni tararken görüntü satırlarını tarayarak tutarlı yatay mürekkep şeritleri arar — bir metin satırını bir sonrakinden ayırt etmek için kullandıkları mekanizma budur. Tamamen düz bir taramada, her metin satırı düzenli bir yatay şerit içinde yer alır ve motor 1. satırı, 2. satırı ve 3. satırı net bir şekilde birbirinden ayırır.
Sayfayı sadece 10 derece bile eğerseniz, o net yatay şerit düzinelerce piksel satırını kapsayan çapraz bir lekeye dönüşür. Motorun satır bölme mantığı, iki ayrı satırda olması gereken karakterleri birleştirmeye başlar ya da tek bir karakteri, iki farklı satır olarak algıladığı yerlere böler. Sonuç “biraz daha az doğru” değildir — bu, kategorik olarak farklı bir çıktıdır; çünkü motorun okuduğu temel birim (bir satır) artık görüntüdeki gerçek içeriğe karşılık gelmemektedir.
Bu aynı zamanda, size tamamen okunabilir görünen bir fotoğrafın bile okunaksız bir OCR çıktısı üretmesinin nedenidir. Görsel sisteminiz, 10 derecelik bir eğimi bilinçli bir çaba sarf etmeden telafi eder — bunu eğik olarak bile algılamazsınız. Basit bir OCR iş akışında böyle bir telafi mekanizması yoktur ve kendisine verilen pikselleri aynen okur.
Çözüm: Tanımlamadan önce düzeltin, sonra değil
Buradan çıkarılacak pratik ders “telefonunuzu daha dikkatli tutun” değildir — açık bir kitabı fotoğraflarken biraz eğilme neredeyse kaçınılmazdır, çünkü sayfayı bir tarayıcıya düz bir şekilde bastırmıyorsunuz. Çözüm otomatiktir: eğim açısını tespit edin ve metin tanıma işlemini çalıştırmadan önce düzeltin, sonra değil.
Karmaşık bir makine öğrenimi modeli kullanmadan açıyı tespit etmenin güvenilir yollarından biri projeksiyon profili yöntemi’dir: görüntüyü olası açı aralığında döndürün ve her bir açı için satır satır mürekkep dağılımının ne kadar “sivri” olduğunu ölçün. Doğru açıda, metin satırları keskin şeritler halinde hizalanır (satırlar arasında yüksek varyans); diğer herhangi bir açıda ise mürekkep satırlar boyunca yayılır (düşük varyans). En yüksek varyansı üreten açı, eğriliği düzeltme açısıdır.
Önce bu düzeltmeyi uygulayıp ardından metni tanıma işlemini gerçekleştirmek, eğik test örneklerimizin her birinde kelime doğruluğunu %100’e geri getirdi — aynı sayfa, aynı OCR motoru; tek fark, önce görüntüyü düzeltmiş olmamızdı.
Bir kitabı dijitalleştiriyorsanız bunun anlamı
- Kağıdın durumu konusunda endişelenmeyin. Sararma, hafif solma ve eskiyen kağıttan kaynaklanan hafif kontrast kaybı, tek başına doğruluğu neredeyse hiç etkilemez. Eski bir ciltsiz kitap, yeni bir kitap kadar iyi dijitalleştirilir.
- Açı konusunda endişelenin. Gözle fark edemeyeceğiniz bir eğim bile, kullanılabilir metin ile okunaksız metin arasındaki tüm farkı oluşturabilir.
- Flaşın neden olduğu parlama, eğim kadar önemli olmasa da yine de sorun yaratır. Parlak kağıt üzerindeki parlak bir nokta, altındaki metni tamamen gizleyebilir — açı düzeltmesi, okunabilir mürekkebin olmadığı bir noktayı düzeltemez.
- Eğimi otomatik olarak düzelten bir araç, asıl sorunu çözer. Kitap sayfasını metne dönüştürme aracımız, tanıma işleminden önce tarayıcınızda tam olarak bu algılama ve düzeltme adımını gerçekleştirir — yükleme yok, sunucu yok ve düz bir tarama gönderdiğinizi varsaymak yerine, özellikle eğim sorununa odaklanarak geliştirilmiştir.
Daha önce bir kitap fotoğrafında OCR denediyseniz ve sonuç okunaksız olduğu için vazgeçtiyseniz, sorun muhtemelen sayfada değildi — birkaç derecelik kamera açısı neredeyse kesin olarak sorunun kaynağıydı.