Taranmış PDF'i EPUB'a çevirmek neden zordur?
Bir belge tarandığında PDF'in içinde aslında sayfa görüntüleri bulunur. Metin, OCR yazılımı tarafından sonradan üretilip görüntünün üzerine görünmez bir katman olarak yerleştirilir. Bu katmanda paragrafın nerede başladığı, hangi satırın başlık olduğu, hangi kelimenin italik olduğu yazmaz — yalnızca sayfada nereye düştüğü belli olan bağımsız satırlar vardır.
Sıradan dönüştürücüler bu satırları olduğu gibi alır. Sonuç, her satırın ayrı paragraf olduğu, sayfa numaralarının metnin ortasına karıştığı, kelimelerin ikiye bölündüğü bir dosyadır. Bu araç bunun yerine metni sıfırdan yeniden kurar.
Dönüştürme sırasında neler yapılıyor?
| Sorun | Yapılan |
|---|---|
| Filigran ve sayfa başlıkları | Sayfaların çoğunda tekrar eden kısa satırlar, kenar bantlarındaki metinler ve gövdeden farklı fontlar ayıklanır |
| Satır sonunda bölünen kelimeler | Heceleme işaretleri kaldırılıp kelimeler birleştirilir |
| Paragraf sınırları | Girinti ölçülerek yeni paragrafın nerede başladığı bulunur; sayfa sınırını aşan paragraf bölünmez |
| OCR harf hataları | Belgenin kendi kelime dağarcığı kanıt alınarak düzeltilir |
| Bölümler | Dizgide bölüm başlarına bırakılan boşluktan tespit edilir, içindekiler otomatik kurulur |
| Kapak ve künye | Kapak görseli ile başlık/yazar bilgisi PDF'ten çıkarılır |
OCR düzeltmesi nasıl güvenli oluyor?
Tarama yazılımları harfleri karıştırır: w harfi çoğu zaman vv olarak okunur. Ancak körlemesine düzeltme yapmak gerçek kelimeleri bozar — Türkçedeki “kuvvet” kelimesi de vv içerir. Bu araç düzeltmeyi dış sözlükle değil, belgenin kendi kelime dağarcığıyla yapar: aynı belgede doğru yazım zaten sıkça geçiyorsa düzeltir, geçmiyorsa kelimeye dokunmaz. Her değişiklik sonuç ekranında listelenir, dilerseniz düzeltmeyi tamamen kapatabilirsiniz.
Sıkça sorulan sorular
Taranmış PDF ile normal PDF arasındaki fark nedir?
Taranmış belgede her sayfa bir görüntüdür; metin, OCR ile üretilip görüntünün üzerine görünmez biçimde yerleştirilir. Bu katmanda paragraf, başlık ve italik gibi hiçbir yapı bilgisi bulunmaz. Bu araç yapıyı sayfa düzeninden yeniden çıkarır.
Dosyalarım saklanıyor mu?
Yüklenen PDF ve üretilen EPUB geçici depolamada tutulur ve 24 saat içinde otomatik olarak silinir. Dosyalar üçüncü taraflarla paylaşılmaz.
Hangi dosya boyutuna kadar destekleniyor?
100 MB'a kadar PDF dosyaları desteklenir. 300 sayfalık tipik bir belge birkaç saniyede dönüşür.
Metin katmanı olmayan PDF'ler çevrilebilir mi?
Evet. Böyle bir dosya yüklerseniz metin tanımayı doğrudan bu sayfada, kendi bilgisayarınızda çalıştırmayı öneririz; dosya bunun için hiçbir yere gönderilmez. İlk kullanımda dil verisi indirilir ve uzun belgelerde işlem birkaç dakika sürebilir.
Yüklediğim dosyalardan kim sorumlu?
Yüklenen dosyaların ve yapılan işlemin sorumluluğu tamamen kullanıcıya aittir. Lütfen yalnızca üzerinde işlem yapma hakkına sahip olduğunuz dosyaları yükleyin.