Почему сканированные PDF такие большие
Письмо на пять страниц, набранное в текстовом редакторе и выгруженное в PDF, обычно занимает меньше 200 КБ. Те же пять страниц, распечатанные, подписанные и отсканированные обратно, легко дотягивают до 15 МБ — в семьдесят пять раз больше при ровно тех же словах. Ничего не сломалось; просто эти два файла — не один и тот же вид объекта. В одном текстовые команды и шрифт. В другом пять фотографий бумаги. Как только вы начинаете видеть в скане фотоальбом, а не документ, всё его поведение становится предсказуемым: почему он огромен, почему в нём нельзя искать, почему конвертация в Word ничего не даёт и почему он сжимается лучше любого другого вашего файла.
Откуда берутся мегабайты
Три настройки сканера перемножаются друг на друга. Первая — разрешение: страница A4 при 300 точках на дюйм это примерно 2480 на 3508 пикселей, около 8,7 миллиона. Поднимите до 600 точек — станет почти 35 миллионов, вчетверо больше данных ради детали, которую не покажет ни один экран и которая не нужна ни одному принтеру для обычного текста. Вторая — глубина цвета: полный цвет хранит три значения на пиксель, градации серого — одно, а чистое чёрно-белое — один бит. Сканировать в цвете страницу с чёрными чернилами на белой бумаге значит утроить сырые данные ещё до сжатия и не получить взамен ничего, кроме бледного бежевого оттенка там, где была бумага. Третья — кодировка, которую выбирает сканер: если он сохраняет страницы без потерь, каждая пылинка и каждое волокно бумаги сохраняются побайтно, и шум самой бумаги становится изрядной частью вашего файла.
Чего стоит фактура бумаги
Последний пункт удивляет. Сжатие работает, находя повторы, и чистое белое поле сжимается почти до нуля. Но отсканированная белая страница не белая: это тысячи чуть различающихся почти белых значений, порождённых зерном бумаги, колебанием лампы и шумом матрицы. Для компрессора без потерь такое поле — непредсказуемая деталь, которую нужно сохранить в точности, поэтому пустая страница стоит настоящих мегабайтов. Сканирование в градациях серого вместо цвета помогает, а сканирование в текстовом режиме или в режиме удаления растра, который есть почти в каждом драйвере, помогает сильнее: эти режимы выравнивают почти белые значения до белого ещё до кодирования страницы. Если вы когда-нибудь удивлялись, почему скан пустого листа тяжелее сорокастраничного текстового документа, вот причина.
Почему нельзя ни искать, ни конвертировать
На отсканированной странице нет никакого текстового слоя. Нет ни глифов, ни кодов символов — только пиксели в форме букв. Поиск в просмотрщике ничего не находит, кнопка копирования ничего не выделяет, а конвертер PDF в Word честно выдаёт пустой документ. Единственный способ добавить текст — оптическое распознавание, которое разглядывает пиксели и угадывает символы. Современное распознавание хорошо справляется с чистыми ровными печатными страницами и ненадёжно с рукописным текстом, выцветшими копиями, печатями, таблицами и всем, что снято под углом. К тому же оно ошибается молча: уверенно неверный символ выглядит точно так же, как верный, поэтому вывод распознавания для чего-то важного — черновик для вычитки, а не восстановленный текст.
Спасти уже присланный файл
Пересканировать чужой документ обычно нельзя, поэтому практическое решение — перекодирование. Это как раз тот случай, где сжатие блистает, ведь скан — чистые данные изображения, а именно их компрессор и умеет переделывать. В наших измерениях отсканированный документ на двенадцать страниц уменьшился с 17,69 МБ до 1,49 МБ — на 91,6 процента — и остался прекрасно читаемым на экране. Такой результат для сканов нормален и недостижим для текстовых документов, которым просто нечего отдать. Проверяйте результат при полном увеличении, а не по миниатюре, и смотрите именно на самые мелкие отметки страницы: подпись, печать, сноску, пометку от руки. Если они уцелели, файл в порядке.
Сделать правильно уже на сканере
Когда скан ваш, важные настройки просты. Берите 300 точек для документов, которые, возможно, придётся увеличивать или распознавать позже, и 200 точек для повседневных бумаг; 600 точек — для фотографий и тонких чертежей, а не для подписанного счёта. Берите градации серого, если цвет не несёт информации: цветная печать, выделенный пункт, диаграмма. Позвольте драйверу сохранять страницы как JPEG внутри PDF, а не без потерь, если он даёт выбор, и включите автоматическое выравнивание перекоса и удаление пустых страниц. Камера телефона в спешке — законный сканер, но снимайте страницу плоско, при ровном свете, заполняя кадр, и пользуйтесь приложением для сканирования, исправляющим перспективу, а не обычной камерой: снятая под углом страница ломает распознавание и выглядит небрежно.
Когда большой размер — правильный ответ
Не всякий большой скан ошибка. Оцифровка рукописей, чертежей, медицинских снимков и всего, что имеет юридический вес, делается намеренно в высоком разрешении, в цвете и без потерь — именно потому, что выброшенное сегодня завтра не вернуть. Правило простое: спросите, кто читает файл и сколько он должен прожить. Скан, который сегодня уходит коллеге, должен быть небольшим и читаемым. Скан свидетельства о собственности, который пролежит тридцать лет, должен быть крупным и точным, а копия для письма — сжатой производной от него, а не самим архивом. Хранить оба, когда документ того заслуживает, стоит немного места на диске и закрывает вопрос навсегда.
Быстрый способ распознать любой файл
Если вы не знаете, какой у вас PDF, всё решают две пятисекундные проверки. Попробуйте выделить курсором предложение: подсвечивается вся страница одним блоком — это изображение, у вас скан. Затем сравните размер с числом страниц: документ, у которого в среднем больше полумегабайта на страницу, почти без исключений насыщен изображениями. Эти две проверки сразу говорят, поможет ли сжатие радикально, сработает ли извлечение текста вообще и не стоит ли на самом деле попросить у отправителя исходный цифровой файл — что очень часто и есть самое быстрое решение.
Частые вопросы
Почему мой скан весит 20 МБ, если в нём всего пять страниц?
Потому что каждая страница — это фотография. При 600 точках в цвете одна страница A4 может превысить 4 МБ до сжатия, так что пять страниц на 20 МБ — арифметика, а не поломка.
Станет ли скан нечитаемым после сжатия?
При разумных настройках нет. Основной текст остаётся чётким, потому что компрессор сохраняет нужное экрану разрешение; исчезает зерно бумаги и цветовой шум, которые вы и не читали.
Можно ли сделать сканированный PDF доступным для поиска?
Только распознаванием, которое добавляет невидимый текстовый слой поверх изображений. На чистых печатных страницах оно работает хорошо, на рукописях, выцветших копиях и сложных таблицах — плохо, поэтому важное обязательно вычитывайте.
Какое разрешение выбрать для документов?
200 точек для повседневных бумаг и 300 точек, если планируете распознавание или увеличение. 600 точек оставьте фотографиям и подробным чертежам.
Сканировать в цвете или в градациях серого?
В градациях серого, если цвет ничего не значит. Это убирает примерно две трети сырых данных и делает чёрный текст чище, а не хуже.
Фотография страницы не хуже скана?
По читаемости часто да, если страница лежит плоско, свет ровный и вы пользуетесь приложением с исправлением перспективы. Для распознавания и для официальных дел настоящий скан по-прежнему заметно надёжнее.
Сжимайте, конвертируйте и разблокируйте PDF прямо во вкладке браузера. PDF перекодирует изображения, которые раздувают файл, собирает документ Word из текстового слоя и ставит или снимает пароли. Измеренный нами скан на двенадцать страниц уменьшился с 17,69 МБ до 1,49 МБ. Файл обрабатывается во вкладке — загрузки на сервер нет.
Открыть инструменты PDF