Конвертировать бенгальский PDF в Word
Бенгальский PDF — циркуляр, бланк, глава книги, скан — превращается в .docx, который можно редактировать: лигатуры и знаки гласных в правильном порядке, а OCR для сканов настроен на бенгальский. Ничего не сохраняется.
- Не сохраняется
- Без очереди и ожидания
- Без регистрации и водяных знаков
Как это работает
Добавьте PDF
Текстовый PDF или скан. Инструмент смотрит на первую страницу и для скана включает OCR; распознаватель уже настроен на бенгальский.
Выберите режим
«Редактируемый текст» даёт обычный документ Word, страница в страницу. «Точный вид» закрепляет каждую строку на её месте поверх изображения страницы — для печати, а не для правки.
Конвертируйте и скачайте
.docx в бенгальском Unicode-шрифте, с заголовками, абзацами, изображениями и ссылками.
Чем бенгальский PDF отличается от других
Перестановка — это и есть главное. Текстовый слой PDF хранит глифы в порядке отрисовки, а бенгальский механизм шейпинга рисует предбазовые знаки гласных (ি, ে, ৈ) перед согласной и разбивает ো и ৌ на два глифа по обе стороны от неё; поэтому из простого экстрактора выходит "স্ব␃াভািবক" там, где на странице написано "স্বাভাবিক". Прежде чем произойдёт что-либо ещё, каждая строка возвращается в логический порядок: знак гласной после своего кластера, реф как র্ перед кластером, на котором он стоит, двухчастные гласные одной кодовой позицией. Результату OCR ничего этого не нужно: распознаватель и так выдаёт логический порядок.
Заголовки, абзацы, ссылки, изображения и разрывы страниц вычисляются точно так же, как на общей странице «PDF в Word»: слова на общей базовой линии — строка, увеличенный промежуток начинает абзац, короткая строка в 1,6 раза крупнее основного текста — заголовок, а аннотация-ссылка становится гиперссылкой Word. «Точный вид» отрисовывает графику страницы с разрешением 144 DPI и помещает поверх неё настоящий текст; «Редактируемый текст» воссоздаёт чистые абзацы в порядке чтения.
Бенгальские цифры остаются бенгальскими цифрами, а латинское слово на странице — адрес электронной почты, номер документа — остаётся латинским. Для скана загружается именно бенгальский пакет, поэтому страница бенгальского текста с английской шапкой читается правильно в бенгальской части, а шапка может прочитаться как бессмыслица бенгальского вида; если английский важен, добавьте его в списке языков.
Если нужно другое
PDF, сделанный из файла Word, — это реконструкция, которой лучше избежать: если можете, попросите .docx. А .docx в Bijoy лучше конвертировать через «Bijoy в Unicode», чем печатать в PDF и конвертировать обратно: нажатия клавиш преобразуются без единой ошибки, оформление сохраняется, и ничего не перечитывается по пикселям.
Для архива отсканированных бенгальских книг настольный инструмент OCR с бенгальской моделью за ночь прочитает папку, а OCRmyPDF добавит слой для поиска к каждому PDF, не меняя его вид, — это правильная форма инструмента для сотен файлов, тогда как эта страница — для одного.
Частые вопросы
Сохраняется ли мой PDF?
Нет. Ничего не сохраняется — ваш файл не хранится. Для скана модуль распознавания и бенгальский языковой пакет загружаются с этого сайта один раз и остаются до следующего использования; сам документ никуда не отправляется.
Почему бенгальский из PDF обычно выходит с ошибками?
Потому что PDF хранит глифы в порядке отрисовки, а для бенгальского это визуальный порядок: и-кар рисуется перед согласной, за которой следует, а две половины ো стоят по обе стороны от неё. Большинство конвертеров копируют этот порядок как есть, поэтому বাংলাদেশ выходит со знаками гласных перед неверными буквами, и каждое слово написано с ошибкой, которую не исправит проверка орфографии. Этот конвертер возвращает знаки туда, где их ожидает Unicode, — та же перестановка нужна любому бенгальскому PDF, включая сделанные на этом сайте.
Справится ли он с PDF, сделанным из документа Bijoy?
Если в PDF есть текстовый слой в SutonnyMJ, текст выйдет нажатиями клавиш Bijoy, потому что именно это записано в файле; пропустите результат через «Bijoy в Unicode» — оформление сохранится. Если PDF — скан, OCR читает изображение и сразу даёт Unicode.
Насколько хорош OCR на бенгальских сканах?
Чистые сканы печатного бенгальского в 300 dpi читаются хорошо; на выцветших ксерокопиях и фото с телефона теряются лигатуры. Язык на этой странице зафиксирован как бенгальский, поэтому латинская шапка бланка или номер документа не могут переключить распознаватель на английский для всей страницы. Страницы, отсканированные с перекосом, сначала выпрямляются.
В каком формате Word я получу файл?
Стандартный .docx в бенгальском Unicode-шрифте, который открывается в Word, Google Docs и LibreOffice. Текст — настоящий Unicode: его можно искать и набирать дальше в Avro или Ridmik.
А таблицы и бланки?
Бланки с линиями в скане в режиме «Редактируемый текст» становятся настоящими таблицами Word. Таблицы в текстовом PDF выходят размещённым текстом, как у любого конвертера из PDF в Word; для электронной таблицы лучше подходит «PDF в Excel».
Полезно знать: Шрифты заменяются: в .docx используется бенгальский Unicode-шрифт, а не шрифт самого PDF, поэтому вид близок к оригиналу, но не идентичен. Текстовые PDF, набранные шрифтом Bijoy, конвертируются как нажатия клавиш Bijoy и затем требуют конвертера «Bijoy в Unicode». OCR игнорирует фото и логотипы, оставляет рукописный текст картинкой и тратит несколько секунд на страницу, потому что распознавание выполняет ваше собственное устройство.
Разместите этот инструмент на своём сайте
Бесплатно для любого блога, страницы класса или справочной статьи. Вставьте один фрагмент кода — и посетители смогут пользоваться инструментом прямо на вашей странице.
Похожие инструменты
PDF в Word
Редактируемый .docx, с OCR для сканов
Распознать бенгальский текст
Бенгальский текст с фото или скана
Bijoy в Unicode
Прочитайте текст в SutonnyMJ как настоящий бенгальский
PDF в текст
Простой текст для копирования и правки
PDF в Excel
Таблицы в настоящую электронную таблицу
PDF в PowerPoint
Редактируемые слайды из любого PDF