Почему в отсканированном PDF не работает поиск
Потому что в нём нет слов. Если понять, что на самом деле лежит в файле, объясняется каждый симптом — и становится ясно, какая одна настройка решает, насколько хорошо это можно исправить.
Проверено
В файле нет слов
PDF может содержать две совершенно разные вещи, которые на экране выглядят одинаково. Документ, экспортированный из Word, содержит текст — настоящие символы, у каждого из которых есть положение и шрифт, — поэтому в нём можно выделить предложение, найти фамилию и скопировать абзац. Отсканированный документ содержит фотографию страницы. В нём нет ничего, кроме пикселей, — ровно так же, как нет ничего, кроме пикселей, в фотографии дорожного знака.
Все симптомы вытекают из этого одного факта. Поиск ничего не находит, потому что искать не в чем. Выделение текста не работает, потому что выделять нечего — вместо этого курсор рисует прямоугольник поверх картинки. Копирование ничего не даёт. Файл слишком тяжёлый для своего объёма, потому что изображения весят много, а слова — нет. А конвертация в Word даёт либо пустой документ, либо документ со вставленной в него картинкой.
Быстрая проверка: попробуйте выделить мышью одно слово. Если появился текстовый курсор и слово подсветилось — текст настоящий. Если появилась рамка — это картинка.
Что на самом деле добавляет OCR
Оптическое распознавание символов считывает формы на картинке и определяет, какие это буквы. Самое полезное происходит дальше: распознанные слова записываются обратно в PDF как невидимый текст, расположенный поверх слов на изображении. Страница выглядит точно так же, как раньше, потому что визуально ничего не изменилось, — но теперь в ней работают поиск, выделение, копирование и индексация.
Это намеренно консервативный подход, и для документов он правильный. Ничего не переверстывается, поэтому договор по-прежнему выглядит как тот договор, который подписали, а исходный скан остаётся визуальным оригиналом. Инструмент Распознать текст в PDF делает это за один проход и обычно заодно выравнивает и поворачивает страницы, ведь для распознавания это всё равно было нужно.
Если вам нужен редактируемый документ, а не документ с поиском, это другая и гораздо более сложная задача: текст нужно извлечь, восстановить макет и заново собрать результат из абзацев и таблиц. Это делает инструмент PDF в Word, и результат всегда требует проверки — в отличие от текстового слоя.
Настройка, которая решает всё: 300 DPI
Точность распознавания зависит от скана намного больше, чем от программы, и самое важное число здесь — разрешение. 300 DPI — стандарт, и он не случаен: при нём обычный основной текст получает около 30 пикселей в высоту — с хорошим запасом больше минимума, нужного, чтобы различать похожие по форме буквы.
При 150 DPI точность заметно падает, и ошибки появляются самые коварные: 1 читается как l, 5 — как S, rn — как m. Ниже качество ухудшается быстро. Больше 300 помогает редко, а файлы становятся намного больше — 600 DPI оправданы только для очень мелкого шрифта или плохих оригиналов.
Ещё три параметра съёмки важны почти так же. Оттенки серого, а не чёрно-белый режим, потому что жёсткий порог уничтожает тонкие элементы букв. Страница ровная и параллельна матрице, потому что у страницы, снятой под углом, буквы меняют форму от края к краю. И равномерное освещение — классическая неудача: ваша собственная тень на странице, которую вы фотографируете сверху.
Что не прочитает никакой OCR
Честность в этом вопросе экономит массу времени. Слитный рукописный почерк универсальный OCR не распознаёт, и причина в самом устройстве, а не в недостатке усилий: распознавание печатного текста основано на поиске границ между буквами, а в прописи их нет. Раздельные буквы от руки, печатные заглавные и клеточки анкет часто распознаются хорошо, потому что это отдельные фигуры с промежутками между ними.
Текст, который является частью фотографии, — надписи на вывеске, на товаре, на пёстром фоне — распознать гораздо труднее, чем текст на бумаге, а сильно стилизованные или декоративные шрифты ещё труднее. Ксерокопии ксерокопий теряют тонкие штрихи, по которым различаются буквы. А документ со штампами, пометками или выделением читается хуже везде, где эти отметки перекрывают текст.
Хороший инструмент сообщает, насколько он уверен, и этим числом стоит пользоваться. Низкая уверенность посреди предложения, которое понятно из контекста, значит гораздо меньше, чем низкая уверенность в цифре номера счёта. Опасны уверенные ошибки, потому что их ничто не выдаёт.
Почему это важно не только ради удобства
Архив сканов без текстового слоя на практике потерян. Его нельзя найти поиском, нельзя проиндексировать, ни одна система комплаенса не найдёт в нём фамилию, и ни одна программа экранного доступа не прочитает его вслух — а во многих юрисдикциях из-за этого его публикация становится юридической проблемой, а не просто неудобством.
Поэтому стоит настоять на правильных настройках при первом же сканировании. Пересканировать коробку документов обходится гораздо дороже, чем один раз отсканировать её как следует, и никакая обработка не вернёт детали, которые не были сняты.
Частые вопросы
Насколько точен OCR на самом деле?
На чистом скане обычного печатного текста в 300 DPI — очень точен: ошибки случаются изредка, а не постоянно. На снимке с телефона, сделанном под углом при плохом освещении, — намного хуже. Качество скана важнее выбора программы.
Изменит ли OCR внешний вид документа?
Нет. Распознанный текст невидимо добавляется поверх существующего изображения, так что страница выглядит точно так же. Обычно в процессе страницы выравниваются и ставятся вертикально — кривые сканы от этого выглядят лучше, а не иначе.
Можно ли редактировать текст после OCR?
В самом PDF — нет: видимая страница по-прежнему картинка, а текстовый слой невидимо лежит поверх неё. Чтобы получить редактируемый документ, конвертируйте распознанный файл в Word и будьте готовы проверить результат.
Работает ли OCR с рукописным текстом?
Раздельные буквы от руки и заполненные анкеты часто распознаются. Слитный почерк — нет, ни в одном универсальном инструменте OCR: буквы сливаются, и границ найти невозможно. Инструменты, обученные именно на рукописях, справляются лучше — ценой отправки ваших страниц третьей стороне.
Почему PDF с поиском стал намного больше?
Он почти не должен меняться — текстовый слой занимает несколько килобайт на страницу. Если файл сильно вырос, страницы, скорее всего, были перерисованы, а не сохранены как есть, и это стоит проверить: смысл текстового слоя в том, что исходное изображение остаётся нетронутым.
Стоит прочитать
PDF слишком большой для почты
Три причины, по которым PDF весит много, и какое решение подходит вашему файлу.
Какой формат изображения?
Всё решает один вопрос. Честное сравнение JPG, PNG, WebP и AVIF.
Как правильно скрыть данные в PDF
Почему чёрная плашка ничего не скрывает и где PDF хранит имена, о которых вы забыли.