Перейти к содержимому

Сделать отсканированный PDF доступным для поиска

Распознайте слова в скане и незаметно наложите их поверх страниц. Документ выглядит так же — просто в нём можно искать, выделять и копировать текст. Страницы, отсканированные криво или боком, выравниваются.

  • Не сохраняется
  • Без очереди и ожидания
  • Без регистрации и водяных знаков

Как это работает

1

Добавьте отсканированный PDF

Перетащите файл. Инструмент проверит, нет ли в нём уже текстового слоя, и предупредит, если OCR сделает только хуже.

2

Проверьте язык

Инструмент читает первую страницу и сообщает, какой язык нашёл. Если нужно выбрать самостоятельно, доступно более 120 языков.

3

Скачайте

Вы получите тот же документ, но со скрытым текстовым слоем за сканом.

Невидимый слой поверх неизменной страницы

Скан сохраняется точно таким, каким был. Добавляется слой текста в невидимом режиме отрисовки — настоящие символы, расставленные слово за словом поверх слов на картинке и помеченные так, чтобы никогда не отображаться. Страница выглядит так же, потому что визуально ничего не изменилось; выделите предложение — и подсветка ляжет на нужные слова, ведь невидимый текст находится там же, где видимые чернила. Это стандартный способ сделать скан доступным для поиска, и именно поэтому по результату можно искать, копировать его и индексировать, хотя он по-прежнему остаётся фотографией документа.

Две вещи в странице исправляются намеренно — распознаванию они всё равно были нужны. Страница, отсканированная боком, поворачивается как надо, а страница, прошедшая через податчик криво, выравнивается, так что результат часто аккуратнее исходника. Размеры страниц берутся из исходного PDF, а не приводятся к одному, поэтому документ со страницами разного размера таким и остаётся, и ничего не масштабируется.

Точность почти целиком зависит от скана, и разница огромна. Чистый скан печатного текста с разрешением 300 DPI распознаётся очень точно; та же страница в 150 DPI — заметно хуже; фото, снятое под углом при плохом освещении, — совсем другая история. Если сканируете вы сами, важна настройка 300 DPI в оттенках серого: большее разрешение редко помогает, а меньшее сразу вредит. Мелкий шрифт, плотный межстрочный интервал, цветной фон, копии с копий и всё проштампованное или рукописное даются тяжелее — и полностью эту проблему не решает ни одна программа.

То, что намеренно не попадает в слой, так же важно, как то, что попадает. Фотографии, логотипы, подписи и декоративная графика игнорируются, а не распознаются, потому что буквы, выжатые из картинки, дают правдоподобную бессмыслицу, которая потом всплывает в каждом поиске. Китайские, японские и корейские слова распознаются, но не попадают в текстовый слой — они подсчитываются для вас, а не записываются пустыми местами, пока не появится шрифт, способный их передать. Документ здесь не перевёрстывается: слова на странице по-прежнему картинка, а чтобы превратить их в редактируемый текст, есть конвертация в Word.

Если нужно другое

OCRmyPDF — инструмент, рядом с которым эта страница лишь удобное дополнение, и он бесплатный. ocrmypdf --deskew --rotate-pages in.pdf out.pdf делает ту же работу с большим контролем, --optimize 3 уменьшает результат, --redo-ocr заменяет плохой существующий слой, а --output-type pdfa за тот же проход создаёт архивный файл. Он справляется с тысячами страниц, работает со слежением за папкой, и именно им пользуются библиотеки и архивы документов.

Для сложных материалов — старинной печати, необычной вёрстки, объёмных таблиц — облачный сервис Google, Amazon или Microsoft прочитает страницы, с которыми универсальное распознавание не справится, потому что эти сервисы обучены на гораздо большем объёме данных. Это реальная разница в возможностях, и о ней стоит знать. Но это также означает отправку ваших документов третьей стороне — ровно тот компромисс, которого эта страница позволяет избежать. Так что это правильный выбор для хрупкой старой книги и неправильный — для коробки медицинских карт.

Частые вопросы

Будут ли страницы выглядеть иначе?

Только ровнее: страница, отсканированная с перекосом на градус или боком, выравнивается. Сам скан сохраняется, а распознанные слова кладутся поверх него невидимыми чернилами — они никогда не отображаются и не печатаются. Меняется лишь то, что Ctrl+F начинает что-то находить.

Мой документ где-нибудь сохраняется?

Нет. При распознавании ничего не сохраняется. Модуль распознавания и языковой пакет загружаются с этого сайта, когда вы впервые используете язык; сам документ никогда не покидает устройство.

Насколько точно распознавание?

На чистых сканах печатного текста — очень точно. Размытые фото, рукописный текст и необычные шрифты снижают точность; перекос исправляется до распознавания. Таблицы с линиями читаются по ячейкам, поэтому подписи полей форм не сливаются с их значениями.

Какие языки поддерживаются?

Более 120, включая английский, бенгальский, хинди, урду, арабский, испанский, французский, китайский, японский и корейский. Письменность определяется по странице; если одной письменностью пользуются несколько языков, выбор решает язык вашего браузера, и его можно поменять.

В текстовом слое не хватает некоторых слов. Почему?

Текстовый слой может содержать только символы, которые умеет записать встроенный шрифт. Для бенгальского, деванагари, арабского, тайского и ещё двух десятков письменностей здесь есть свои шрифты; для китайского, японского и корейского — пока нет, поэтому такие слова подсчитываются для вас, а не сохраняются пустыми местами. Инструмент «PDF в Word» с OCR выдаст этот текст полностью.

Сколько это занимает времени?

Несколько секунд на страницу, потому что распознаёт ваше собственное устройство, а не серверная ферма. Прогресс показывается постранично.

Полезно знать: Китайские, японские и корейские слова не попадают в текстовый слой — они подсчитываются для вас, а не сохраняются пустыми местами, пока не появится подходящий для них шрифт; все остальные известные модулю письменности записываются. Фотографии, логотипы и подписи игнорируются, чтобы не превращаться в бессмысленный текст. Рукописный текст ни один универсальный инструмент OCR надёжно не распознаёт.

Разместите этот инструмент на своём сайте

Бесплатно для любого блога, страницы класса или справочной статьи. Вставьте один фрагмент кода — и посетители смогут пользоваться инструментом прямо на вашей странице.