Конвертировать PDF в Word
Превратите любой PDF в редактируемый документ Word — вместе с изображениями, с режимом «Точный вид», повторяющим исходные страницы, и встроенным OCR для сканов. Ничего не сохраняется: ваш файл не хранится.
- Не сохраняется
- Без очереди и ожидания
- Без регистрации и водяных знаков
Как это работает
Добавьте PDF
Перетащите PDF на страницу. Инструмент автоматически проверит его и включит OCR, если обнаружит скан.
Выберите режим
«Редактируемый текст» — режим по умолчанию — даёт обычный документ Word, страница в страницу с PDF: абзацы, заголовки, жирный и курсив, ссылки и изображения, каждая страница в исходном размере со своими полями и межстрочным интервалом, так что 12-я страница PDF — это 12-я страница документа, а файл примерно того же размера, что и PDF. «Точный вид» закрепляет каждую строку на её месте поверх изображения страницы — он повторяет PDF для печати, но его трудно редактировать, и он в несколько раз больше. Для сканов OCR включается сам, определяет язык по первой странице и выпрямляет страницы, отсканированные с перекосом.
Конвертируйте и скачайте
Нажмите «Конвертировать в Word» и скачайте аккуратный .docx с заголовками и абзацами, готовый к редактированию.
Что конвертируется чисто, а что нет
PDF записывает глифы в координатах. В нём нет абзацев и, если его специально не разметили тегами, нет заголовков — поэтому и то и другое вычисляется, а не считывается. Слова на общей базовой линии становятся строкой, увеличенный вертикальный промежуток начинает новый абзац, а короткая строка размером примерно в 1,6 раза больше медианного размера основного текста становится «Заголовком 1», в 1,3 раза — «Заголовком 2». Это правило стоит знать до начала правки: если заголовки в документе выделены жирным, но не крупнее основного текста, они придут как обычный текст, и область навигации Word будет пустой.
Ссылки сохраняются, и это многих удивляет. Аннотация-ссылка поверх фрагмента текста становится настоящей гиперссылкой Word, а пункт оглавления или перекрёстная ссылка, ведущие на двенадцатую страницу, становятся внутренней ссылкой на закладку, поставленную в начале этой страницы, — так что оглавление продолжает работать и после конвертации.
Две вещи не считываются вовсе. Ответы в заполненной PDF-форме хранятся в объектах полей, а не на странице, поэтому в «Редактируемом тексте» их просто нет; «Точный вид» их показывает, потому что они часть изображения страницы, но не как текст, который можно править. Комментарии и штампы — объекты того же рода, и с ними происходит то же самое. А в «Точном виде» графика отрисовывается один раз с разрешением 144 DPI, и поверх неё помещается настоящий текст, так что логотип или диаграмма, которые в PDF были векторными, в .docx становятся картинкой, и при увеличении это заметно.
Если нужно другое
Если вам нужны сами слова, а не документ Word, pdftotext -layout file.pdf из Poppler работает быстрее и предсказуемее, разделяет столбцы пробелами и обычно используется, чтобы передать PDF куда-то ещё. А если PDF изначально был сделан из файла Word, попросите у автора .docx: любая обратная конвертация — это реконструкция по координатам, и только оригинал ею не является.
Таблицы — слабое место любого конвертера из PDF во что угодно, включая этот. Если документ состоит в основном из таблиц и цифры важны, Tabula и Camelot бесплатны, созданы именно для этой задачи и справятся с ней лучше универсального конвертера.
Частые вопросы
Сохраняется ли мой PDF при конвертации?
Нет. Оба режима конвертации ничего не сохраняют — ваш файл не хранится. При OCR модуль распознавания и языковой пакет загружаются с этого сайта в первый раз; сам документ никуда не отправляется.
Можно конвертировать отсканированные PDF и фото документов?
Да. Включите OCR (инструмент сам предложит это, если обнаружит скан) — и текст будет распознан с изображений страниц. Язык определяется по странице — поддерживается более 120 языков, включая английский, бенгальский, хинди, урду, арабский, испанский и китайский, — а если догадка неверна, его можно выбрать вручную. Бланки с линиями в режиме «Редактируемый текст» превращаются в настоящие таблицы Word.
Насколько точно работает OCR?
На чистых сканах печатного текста точность очень высокая. Качество падает на размытых фото, рукописном тексте и необычных шрифтах. Лучший результат дают чёткие, ровные и хорошо освещённые сканы.
Сохранятся ли оформление и изображения?
Да. «Точный вид» сохраняет исходный размер каждой страницы и воссоздаёт её в два слоя: каждое фото, логотип, цветная полоса и элемент векторной графики воспроизводятся в точности так, как их рисует PDF, а поверх на исходном месте лежит настоящий текст — с исходными цветами, жирным шрифтом и заголовками. «Редактируемый текст» вместо этого воссоздаёт чистые абзацы и заголовки с изображениями в порядке чтения, страница в страницу с PDF, — это лучший выбор, если вы собираетесь много править.
В каком формате Word я получу файл?
Стандартный файл .docx, который открывается в Microsoft Word, Google Docs, LibreOffice и любом современном редакторе.
Есть ли ограничение по страницам или размеру?
Жёсткого ограничения нет. OCR тратит несколько секунд на страницу, потому что распознавание выполняет ваше собственное устройство, так что очень длинные сканы просто обрабатываются дольше — индикатор прогресса показывает, где именно идёт работа.
Полезно знать: Шрифты заменяются близкими аналогами, потому что PDF встраивает собственные шрифты, а Word не может их использовать, — поэтому «Точный вид» почти идентичен оригиналу, но не до пикселя, и строка может выйти чуть шире или уже исходной. Таблицы в текстовых PDF конвертируются как размещённый текст, а не как таблицы Word; в сканах таблицы с линиями становятся таблицами Word, а таблицы без линий остаются размещённым текстом. OCR намеренно игнорирует фото, логотипы и декоративную графику, чтобы они не превращались в мусорные символы, оставляет рукописный текст и печати картинками и тратит несколько секунд на страницу.
Разместите этот инструмент на своём сайте
Бесплатно для любого блога, страницы класса или справочной статьи. Вставьте один фрагмент кода — и посетители смогут пользоваться инструментом прямо на вашей странице.
Ещё Инструменты для PDF
PDF в текст
Простой текст для копирования и правки
PDF в Excel
Таблицы в настоящую электронную таблицу
Редактировать PDF
Правка текста, добавление, рисование и подпись
PDF в PowerPoint
Редактируемые слайды из любого PDF
PDF в JPG
Каждая страница — изображение JPG
PDF в PNG
Чёткие изображения страниц без потерь