Перейти к содержимому

Конвертировать PDF в текст

Достаньте слова из PDF с сохранёнными строками и абзацами — скопируйте их сразу в буфер обмена или скачайте файлом .txt. Ничего не сохраняется.

  • Не сохраняется
  • Без очереди и ожидания
  • Без регистрации и водяных знаков

Как это работает

1

Добавьте PDF

Перетащите PDF на страницу. Извлечение начнётся сразу, страница за страницей.

2

Прочитайте и поправьте

Текст появится в редактируемом поле. Включите или отключите отметки разрывов страниц и поправьте что угодно перед сохранением.

3

Скопируйте или скачайте

Скопируйте всё в буфер обмена или скачайте файлом .txt.

Откуда берутся слова и в каком порядке они приходят

Символы в PDF хранятся не как текст. Они хранятся как номера глифов во встроенном шрифте, а чтобы превратить их обратно в буквы, нужна таблица внутри файла, где сказано, какой символ означает каждый глиф. Большинство программ её записывают. Когда её нет — а обычно виноваты урезанные подмножества шрифтов, которые создаёт некоторый дизайнерский софт, — страница на экране выглядит идеально, а извлекается абракадаброй, потому что сведения, нужные для чтения, так и не были записаны. Никакой экстрактор этого не исправит: здесь не сложная задача, а просто отсутствующие данные.

Прежде чем доверять результату, проверьте порядок чтения. Текст выходит в том порядке, в котором страница его рисует, то есть в том, в каком его случайно выдала программа, создавшая PDF, — и часто это не тот порядок, в котором читает человек. Двухколоночная страница нередко извлекается как левая и правая колонки, аккуратно разделённые, или как строки вперемешку — всё зависит от того, как её сгенерировали. Колонтитулы, номера страниц и врезки оказываются там, где их нарисовали, — обычно посреди основного текста.

Несколько мелких артефактов лучше знать в лицо, чем ломать над ними голову. Лигатуры приходят тем единственным символом, который реально использовал шрифт, так что в английском «find» сочетание fi может прийти одним глифом, а не буквой f и следом i, — и простой поиск по «find» это слово пропустит. Слова, перенесённые с дефисом на границе строки, так и остаются с дефисом, потому что перенос в файле настоящий. А прямые кавычки часто оказываются типографскими — это важно, если текст пойдёт в код или в CSV.

Отсканированная страница не даёт вообще ничего, и инструмент прямо об этом говорит, вместо того чтобы вернуть пустой файл: на фотографии документа нет символов, только пиксели. То же касается текста, переведённого в кривые, — дизайнеры делают это намеренно, чтобы файл везде печатался одинаково, и к этому моменту это уже действительно графика. В обоих случаях нужно не извлечение, а OCR.

Если нужно другое

Когда важны колонки, pdftotext -layout in.pdf out.txt из Poppler справляется лучше всего, что может браузер: он воссоздаёт визуальные отступы настоящими пробелами, так что колонки остаются колонками, а таблица — читаемой таблицей. pdftotext -raw идёт в обратную сторону и отдаёт нетронутый порядок отрисовки — иногда именно это и нужно скрипту.

Для текста из сотен файлов основой стоит взять mutool draw -F txt и питоновский pdfplumber — pdfplumber, в частности, отдаёт каждый символ с координатами, шрифтом и размером, так что колонтитулы можно отфильтровать по положению, а не наугад. Этого эта страница сделать не может, а при больших объёмах важно именно это.

Частые вопросы

Сохраняются ли абзацы и переносы строк?

Да. В PDF вообще нет абзацев — только символы с координатами, — поэтому текст восстанавливается так: слова на общей базовой линии собираются в строку, а там, где вертикальный промежуток становится шире, начинается новый абзац. Результат читается как оригинал, а не как один сплошной поток.

Сохраняется ли мой PDF где-нибудь?

Нет. Текст читает ваш собственный браузер, и он никуда не отправляется. После загрузки страницы можно отключиться от интернета — всё продолжит работать.

Пишет, что в моём PDF нет текста, — почему?

Потому что это скан или фото: страница — это картинка, а в картинке нет текста, который можно извлечь. Воспользуйтесь инструментом «Распознать текст в PDF» — он читает слова прямо с изображения.

Можно ли отредактировать текст перед скачиванием?

Да — поле полностью редактируемое, и сохраняется ровно то, что вы видите.

А как с таблицами и колонками?

Колонки читаются в том порядке, в котором их рисует PDF. Обычно это правильно, но в сложной многоколоночной вёрстке строки могут перемешаться. Таблицы выходят строками текста, а не сеткой — для таблиц используйте «PDF в Excel».

Полезно знать: Простой текст не несёт форматирования: жирный шрифт, размеры, цвета, изображения и структура таблиц отбрасываются по определению. Текст, нарисованный векторными контурами, а не настоящими символами (так часто бывает в логотипах и некоторых дизайнерских PDF), без OCR не извлечёт ни один инструмент.

Разместите этот инструмент на своём сайте

Бесплатно для любого блога, страницы класса или справочной статьи. Вставьте один фрагмент кода — и посетители смогут пользоваться инструментом прямо на вашей странице.