PDF'i Word'e çevirmek
PDF dosyasının içinde paragraf yoktur. Harfler vardır: her biri bir yazı tipine bağlı, sayfada belirli bir noktaya konmuş tek tek karakterler. Cümle yoktur, başlık yoktur, madde işareti yoktur; bunları gözünüz boşluklara bakarak kurar. Dolayısıyla dünyadaki bütün PDF-Word çeviricileri, bizimki dahil, çeviri değil yeniden inşa yapar: binlerce konumlanmış harfi okur ve hangilerinin aynı satıra, hangi satırların aynı paragrafa ait olduğunu, hangi paragrafın aslında başlık olarak tasarlandığını tahmin eder. Bu tek gerçeği bilmek, aldığınız sonuçların neredeyse tamamını açıklar: düzgün bir raporun neden tertemiz döndüğünü, iki sütunlu bir akademik makalenin neden karıştığını, taranmış bir sözleşmenin hangi programı kullanırsanız kullanın neden bomboş bir belge verdiğini.
Çevirici aslında neyi okuyor
PDF'in metin katmanı bir çizim komutları listesidir. Her komut özetle şunu söyler: şu yazı tipinden şu harf dizisini, şu x-y koordinatına, şu punto ile koy. Çevirici bu listeyi baştan sona gezer ve gruplamaya başlar. Küçük bir tolerans içinde aynı taban çizgisini paylaşan harfler bir satır olur. Aralarındaki dikey boşluk, çevredeki satır aralığıyla uyuşan satırlar bir paragraf olur; belirgin biçimde büyük bir boşluk paragrafı bitirir. Sayfadaki en yaygın gövde puntosuna göre daha büyük ve kalın dizilmiş bir satır büyük ihtimalle başlıktır ve .docx dosyasına kalın metin olarak değil, gerçek bir başlık stili olarak yazılır. Satır başındaki madde imleri ya da numaralar, altındaki satırlarda tutarlı bir girinti varsa, liste maddesine dönüşür. Bunların hiçbiri dosyada yazmaz; hepsi çıkarımdır ve kullanılabilir bir çıktıyla dağınık satır yığını arasındaki fark tam da bu çıkarımdır.
Yeniden inşanın tökezlediği yerler
Üç sayfa düzeni bu varsayımları kırar. Birincisi çok sütunlu sayfalar: yan yana duran iki sütun aynı taban çizgilerini paylaşır, dolayısıyla naif bir okuyucu sol sütunun satırını sağ sütunun satırına ekler ve ortaya anlamsız bir metin çıkar. Doğrusu, sütun arasındaki boşluğu tespit edip her sütunu aşağıya kadar okumaktır. İkincisi tablolar: tablo, koordinatlara yerleştirilmiş metin artı bazen çizgilerdir — çoğu zaman çizgi bile yoktur, yani ayrıştırıcı için tablo ile düzgün hizalanmış bir rakam listesi görsel olarak aynı şeydir. Üçüncüsü numaralı başlıklardır. "1. Hizmetin Kapsamı" diye başlayan bir satır, numaralı listenin ilk maddesine birebir benzer; hangisini alacağınıza çeviricinin içindeki iki testin sırası karar verir. Biz de bu tuzağa düştük ve başlık testini liste testinin önüne almak zorunda kaldık: insanların gerçekten çevirdiği belgelerde numaralı başlık, tek maddelik listeden çok daha sık görülüyor.
Taranmış PDF hiçbir şey vermez, dürüstçe
Sayfa bir tarayıcıdan ya da telefon kamerasından çıktıysa içinde tek bir büyük görsel vardır, metin katmanı hiç yoktur. Gruplanacak harf olmadığı için yeniden inşa edilecek bir şey de yoktur. Aracın iki seçeneği vardır: boş bir belge vermek ya da optik karakter tanıma (OCR) çalıştırıp piksellerden metin uydurmak. Biz OCR yapmıyoruz; bu yüzden dosyayı reddedip sebebini söylüyoruz, size üç sayfası boş bir .docx uzatmıyoruz. Bu göründüğünden önemli: gerçek dünyadan denediğimiz, okunabilir beş PDF'in üçü taranmış çıktı. Dosyanız bu gruptaysa dürüst adım bir OCR aracına gitmektir ve onun çıktısını da kurtarılmış metin değil, düzeltilmesi gereken taslak saymalısınız — OCR karakteri şekilden tahmin eder ve kendinden emin yanlışlar onun normal hata biçimidir.
Yazı tipi, kodlama ve bozuk karakter sorunu
İkinci ve daha sessiz bir hata biçimi karakter eşlemesidir. PDF, yazı tipinin yalnız kullanılan harflerini kendi iç numaralandırmasıyla gömebilir ve bu numaraları gerçek karakterlere geri çeviren bir tablo verir. Bu tablo eksik ya da yanlışsa — eski dizgi yazılımlarından çıkan dosyalarda ve Türkçe karakterleri baskı anında değiştirilmiş belgelerde çok görülür — çıkan metin inandırıcı görünen bir çöp olur: kelime şekilleri doğru, harfler yanlış. Çevirici bunu dosyadan onaramaz, çünkü bilgi orada yoktur. Belirtisi şudur: aynı belgede PDF okuyucunun arama işlevi de çalışmaz. Ekranda açıkça gördüğünüz bir kelimeyi Ctrl+F ile aratın; okuyucu da bulamıyorsa eşleme bozuktur ve her araç aynı karmaşayı üretecektir. Bu durumda istediğiniz şey PDF değil, belgenin kaynak dosyasıdır.
Çıktıya güvenmeden önce dört kontrol
.docx dosyasını açın ve sırayla dört şeye bakın. Birincisi: metin doğru sırada mı akıyor? İlk sayfayı baştan sona okuyun, çünkü sütun karışması orada apaçık görünür, göz gezdirmede ise hiç görünmez. İkincisi: başlıklar gerçekten başlık mı? Bir başlığa tıklayıp stil kutusuna bakın; "Başlık 1" yazıyorsa içindekiler tablosunu yeniden kurabilirsiniz, "Normal" yazıyorsa elinizde yalnızca kalın metin var. Üçüncüsü: varsa tabloya bakın, bir değer bir sütun kaymış mı? Dördüncüsü: belgenin ortasında olduğunu bildiğiniz bir sayıyı aratın — bir toplam, bir tarih, bir fatura satırı — ve hayatta kaldığını doğrulayın. Çünkü en pahalıya patlayan ve en az fark edilen hata, sessizce düşen içeriktir. Kendi doğrulama takımımız her derlemede tam olarak bu son kontrolü koşuyor; sebebi de insan gözünün atladığı kontrolün bu olması.
Hangi belgeler iyi çevrilir
Pratik bir seçim kuralı: belge bir kelime işlemciden ya da resmî bir sistemden dijital olarak üretildiyse ve tek sütunluysa, sonuç genellikle doğrudan üzerinde çalışılabilir. Sözleşmeler, resmî yazılar, e-devlet çıktıları, banka dekontları ve raporlar bu gruba girer. Grafik ağırlıklı broşürler, dergi sayfaları, iki sütunlu makaleler ve tasarım dosyaları ise biçim olarak değil, yalnız metin olarak kurtarılır — düzeni yeniden kurmak sizde kalır. Bir belgenin hangi grupta olduğunu anlamanın en hızlı yolu, PDF okuyucuda bir cümleyi imleçle seçmeye çalışmaktır: cümle seçiliyorsa metin katmanı vardır ve çevrilebilir, bütün sayfa tek blok halinde seçiliyorsa elinizdeki bir görüntüdür.
Sık sorulan sorular
PDF'i biçimi bozulmadan Word'e çevirebilir miyim?
Tam olarak hayır ve bunu hiçbir araç dürüstçe vaat edemez. Yazı tipleri, satır sonları ve piksel düzeyindeki boşluklar PDF'in sabit düzenine aittir; Word belgesi ise akar. Metnin, başlıkların, listelerin ve basit tabloların korunmasını bekleyin, karmaşık düzeni elle düzeltmeyi hesaba katın.
Çevrilen belgem neden boş çıktı?
Neredeyse her zaman PDF taranmış olduğu için: her sayfa tek bir görsel ve metin katmanı yok. PDF okuyucuda bir kelimeyi seçmeyi deneyin; tek bir kelimeyi bile seçemiyorsanız çıkarılacak metin yoktur ve OCR gerekir.
Dosya bir sunucuya yükleniyor mu?
Bizim aracımızda dönüştürme tarayıcı sekmesinde çalışır, yani belge kendi bilgisayarınızda işlenir. Bu bir gizlilik özelliğidir, kalite özelliği değil — yukarıdaki yeniden inşa sınırları her yerde aynıdır.
İki sütunlu makalem neden karıştı?
Çünkü iki sütunun satırları aynı yatay hizayı paylaşıyor ve aşağı doğru değil, yana doğru okunmuş. Bazı belgeler sütun tespitini tamamen yener; onlarda sayfa sayfa çevirip sırayı elle düzeltmek genellikle araçla boğuşmaktan hızlıdır.
Görseller Word dosyasına aktarılıyor mu?
Bizim çeviricimizde öncelik metindir, sayfa düzenindeki görseller yeniden üretilmez. Belgenin asıl değeri görsellerse, onları ayrıca çıkarmak doğru yoldur; .docx dosyasından bire bir kopya beklemeyin.
Hedef biçim .docx mi olmalı, .rtf mi?
.docx kullanın. Word, Google Dokümanlar ve LibreOffice üçünün de doğrudan okuduğu biçim odur ve gerçek başlık stillerini, liste yapılarını taşıyabilir — yani yeniden inşanın saklamaya değer kısmını.
Şifreli bir PDF'i doğrudan çevirebilir miyim?
Hayır. Şifreli dosyada metin akışları şifrelenmiş durumdadır, yani okunacak harf yoktur. Önce parolayı bilerek şifreyi kaldırmanız, sonra çevirmeniz gerekir; sıra tersine çalışmaz.
Çeviri sonrası en sık hangi düzeltmeyi yapmak gerekir?
Paragraf aralıkları ve sekme ile hizalanmış bölümler. Metin doğru gelir ama boşluklar PDF'teki konumlardan üretildiği için Word'de gereğinden fazla boş satır ya da sekme birikebilir; bunları toplu bul-değiştir ile temizlemek birkaç dakika sürer.
PDF sıkıştırma, Word'e çevirme ve şifre işlemleri — kendi tarayıcı sekmenizde. PDF, dosyayı şişiren görselleri yeniden kodlar, metin katmanından bir Word belgesi kurar ve parola ekler ya da kaldırır. Ölçtüğümüz on iki sayfalık bir tarama 17,69 MB'tan 1,49 MB'a indi. Dosya sekmede işlenir — yükleme yoktur.
PDF araçlarını aç