PDF← Руководство

Как конвертировать PDF в Word

В PDF нет абзацев. В нём есть глифы — отдельные символы, у каждого своя ссылка на шрифт и своя позиция на странице. Ни предложений, ни заголовков, ни списков там не хранится; всё это собирает ваш глаз по расстояниям между знаками. Поэтому любой конвертер PDF в Word, включая наш, занимается не переводом, а реконструкцией: он читает тысячи расставленных по координатам глифов и угадывает, какие из них принадлежат одной строке, какие строки образуют абзац и какой абзац задумывался как заголовок. Понимание этого единственного факта объясняет почти всё, что вы видите в результатах: почему аккуратный отчёт конвертируется превосходно, почему научная статья в две колонки выходит перепутанной и почему отсканированный договор даёт пустой документ, каким бы инструментом вы ни пользовались.

Открыть инструменты PDF →Сжимайте, конвертируйте и разблокируйте PDF прямо во вкладке браузера.

Что на самом деле читает конвертер

Текстовый слой PDF — это список команд рисования. Каждая по сути говорит: помести вот эту последовательность глифов вот этого шрифта в такие-то координаты x и y, такого-то кегля. Конвертер проходит по списку и начинает группировать. Глифы, у которых базовая линия совпадает в пределах небольшого допуска, становятся строкой. Строки, вертикальный промежуток между которыми соответствует окружающему интерлиньяжу, становятся абзацем; заметно больший промежуток абзац завершает. Кегль и насыщенность шрифта в сравнении с самым частым основным текстом страницы решают, что станет заголовком: строка на сорок процентов крупнее, за которой идёт обычный абзац, почти наверняка заголовок, и в .docx она записывается именно как заголовок, а не как жирный текст. Маркеры или номера в начале строки при постоянном отступе ниже превращаются в элементы списка. Ничего из этого в файле не записано; всё это вывод, и именно от него зависит, получите вы пригодный документ или стену несвязанных строк.

Где реконструкция ломается

Три вида вёрстки нарушают эти допущения. Многоколоночные страницы — классический случай: две соседние колонки делят базовые линии, поэтому наивный алгоритм пришивает строку левой колонки к строке правой и выдаёт бессмыслицу. Нужно распознать межколонник и дочитать каждую колонку до низа, прежде чем переходить к соседней. Таблицы — второй случай: таблица — это текст по координатам плюс иногда линейки, а часто и вовсе без линеек, так что для разборщика таблица и аккуратно выровненный список цифр выглядят одинаково. Третий случай — нумерованные заголовки. Строка, начинающаяся с «1. Предмет договора», выглядит ровно как первый пункт нумерованного списка, и порядок двух проверок внутри конвертера решает, что вы получите. Мы сами на этом споткнулись и вынуждены были поставить проверку заголовка перед проверкой списка: в документах, которые люди действительно конвертируют, нумерованный заголовок встречается куда чаще, чем список из одного пункта.

Сканированные PDF не дают ничего, и это честно

Если страница получена сканером или камерой телефона, в ней одно большое изображение и вовсе нет текстового слоя. Группировать нечего, значит и восстанавливать нечего. У инструмента два выхода: вернуть пустой документ или запустить оптическое распознавание и придумать текст по пикселям. Мы не делаем распознавание, поэтому отказываем файлу и объясняем причину, а не вручаем вам .docx с тремя пустыми страницами. Это важнее, чем кажется: в небольшой выборке настоящих документов, на которых мы проверяли, три из пяти читаемых PDF оказались сканами. Если ваш файл из этой группы, честный следующий шаг — инструмент распознавания, а его вывод стоит считать черновиком для вычитки, а не восстановленным текстом: распознавание угадывает символы по форме, и уверенно ошибаться — его обычный способ отказа.

Шрифты, кодировка и проблема испорченных символов

Есть и второй, более тихий сбой — сопоставление символов. PDF может встроить подмножество шрифта с собственной внутренней нумерацией и приложить таблицу, возвращающую эти номера к настоящим символам. Когда такой таблицы нет или она неверна — обычное дело для файлов из старых вёрсточных программ и для документов, в которых при печати подменили кириллицу — извлечённый текст выходит правдоподобным мусором: формы слов верные, буквы не те. Конвертер не может починить это по файлу, потому что нужных сведений там попросту нет. Признак такой: тот же документ не ищется и в просмотрщике PDF. Найдите через Ctrl+F слово, которое ясно видите на экране; если просмотрщик его тоже не находит, сопоставление сломано и любой инструмент выдаст ту же кашу. В этом случае вам нужен исходный документ, а не PDF.

Как проверить результат, прежде чем ему доверять

Откройте .docx и проверьте четыре вещи по порядку. Первое: текст идёт в правильном порядке? Прочитайте первую страницу целиком, потому что ошибки колонок там видны сразу и совершенно незаметны при беглом взгляде. Второе: заголовки — настоящие заголовки? Щёлкните по одному и посмотрите в поле стилей; если там «Заголовок 1», оглавление можно собрать заново, если «Обычный» — у вас просто жирный текст. Третье: посмотрите таблицы и убедитесь, что ни одно значение не сползло на колонку. Четвёртое: найдите число, которое точно стоит в середине документа — итог, дату, строку счёта — и убедитесь, что оно уцелело, потому что потерянное содержимое обходится дороже всего и замечается реже всего. Наш собственный набор проверок выполняет именно эту последнюю при каждой сборке — как раз потому, что живой проверяющий её пропускает.

Какие документы конвертируются хорошо

Практическое правило: если документ родился цифровым в текстовом редакторе или в государственной системе и свёрстан в одну колонку, результат обычно можно править сразу. Договоры, официальные письма, справки, банковские выписки и отчёты попадают в эту группу. Насыщенные графикой буклеты, журнальные полосы, статьи в две колонки и файлы вёрстки спасаются только как текст, но не как оформление: собирать макет заново придётся вам. Быстрее всего определить группу так: попробуйте выделить курсором предложение в просмотрщике PDF. Выделяется предложение — есть текстовый слой и конвертация возможна; выделяется вся страница одним блоком — перед вами изображение.

Частые вопросы

Можно ли конвертировать PDF в Word без потери форматирования?

Полностью — нет, и ни один инструмент не может честно это обещать. Шрифты, точные переносы строк и попиксельные отступы принадлежат фиксированной вёрстке PDF; документ Word, напротив, переливается. Рассчитывайте сохранить текст, заголовки, списки и простые таблицы и заложите время на ручную правку сложной вёрстки.

Почему сконвертированный документ пустой?

Почти всегда потому, что PDF — это скан: по изображению на страницу и никакого текстового слоя. Попробуйте выделить текст в просмотрщике; если не удаётся подсветить ни одного слова, извлекать нечего и нужно распознавание.

Файл загружается на сервер?

В нашем инструменте конвертация выполняется во вкладке браузера, то есть документ обрабатывается на вашей машине. Это свойство приватности, а не качества: описанные выше пределы реконструкции одинаковы везде.

Почему статья в две колонки перемешалась?

Потому что строки обеих колонок находятся на одной высоте и были прочитаны поперёк, а не сверху вниз. Некоторые документы полностью ломают определение колонок; для них обычно быстрее конвертировать постранично и переставить куски вручную.

Сохраняются ли изображения в файле Word?

В нашем конвертере приоритет у текста, изображения вёрстки не воспроизводятся. Если смысл документа именно в изображениях, извлеките их отдельно, а не ждите факсимиле в .docx.

Что лучше — .docx или .rtf?

Берите .docx. Его нативно читают Word, Google Документы и LibreOffice, и он умеет выражать настоящие стили заголовков и структуры списков — то есть ту часть реконструкции, которую стоит сохранить.

Сжимайте, конвертируйте и разблокируйте PDF прямо во вкладке браузера. PDF перекодирует изображения, которые раздувают файл, собирает документ Word из текстового слоя и ставит или снимает пароли. Измеренный нами скан на двенадцать страниц уменьшился с 17,69 МБ до 1,49 МБ. Файл обрабатывается во вкладке — загрузки на сервер нет.

Открыть инструменты PDF
Язык: TR EN DE ES FR IT PT AR RU JA KO