Перейти к содержимому

Распознать бенгальский текст с картинки

Наведите на фото страницы, скан или скриншот — и получите бенгальский текст в Unicode: его можно искать, редактировать и вставлять. Распознаватель настроен на бенгальский ещё до того, как появится картинка, поэтому ничего не нужно определять и выбирать. Ваше изображение никогда не сохраняется.

  • Не сохраняется
  • Без очереди и ожидания
  • Без регистрации и водяных знаков

Как это работает

1

Добавьте изображение

Фото страницы книги, старый циркуляр, отсканированный сертификат или скриншот бенгальского текста. Подходят JPG, PNG, WebP, HEIC и TIFF; снимок, сделанный под углом, сначала выпрямляется.

2

Дайте ему прочитать

Бенгальский уже выбран. Если на странице есть и английский — бланк, шапка письма, — добавьте его из списка, и будут распознаны оба языка.

3

Скопируйте как Unicode

Текст получается в Unicode, каким бы шрифтом ни был напечатан оригинал: циркуляр в SutonnyMJ читается как обычный бенгальский, а не как "evsjv‡`k". Сохраните вёрстку или объедините строки, затем скопируйте или скачайте.

Как бенгальский влияет на распознавание

Бенгальская модель читает кластеры, а не отдельные буквы. Лигатура вроде ক্ষ или ন্ত্র — это одна фигура на странице, и модели нужно решить и что это, и как это раскладывается в Unicode, — вот почему ошибка в бенгальском обычно даёт неверную лигатуру или знак гласной не на той букве, а не просто неверную букву. Результат выдаётся в том порядке, какого ожидает Unicode: знак гласной следует за своим кластером согласных, реф записывается как র + хасанта перед кластером, на котором стоит, а двухчастные гласные выходят одной кодовой позицией. Именно такого порядка ждут любое поле поиска, проверка орфографии и шрифт, и он противоположен визуальному порядку, в котором работает наборщик в Bijoy.

Всё, что делает обычный распознаватель, делается и здесь: освещение бумаги выравнивается, страница выпрямляется, таблицы с линиями читаются по ячейкам, чтобы подпись не слилась со значением, а результат возвращается либо в вёрстке страницы, либо объединённым в абзацы. Числа читаются бенгальскими цифрами, если напечатаны бенгальскими цифрами; бланк, в котором смешаны ০১২ и 012, сохраняет и те и другие.

Бенгальский не делит свою модель ни с одним другим языком, но на картинке всё же может быть английский — шапка бланка, номер документа, блок подписи, — и один язык читает другой как бессмыслицу. Если добавить английский из списка, страница читается обоими пакетами, и каждое слово остаётся в той письменности, в какой было напечатано.

Если нужно другое

Документ в Bijoy, который всё ещё существует как файл, лучше конвертировать, чем фотографировать. OCR восстанавливает текст по пикселям и даже на лучшей странице ошибается в нескольких символах из тысячи; конвертер «Bijoy в Unicode» восстанавливает его по нажатиям клавиш, не ошибается вовсе и сохраняет жирное начертание и таблицы. Фотографируйте страницу, только если файла больше нет.

Для целой книги или архива сканов правильная форма инструмента — настольная: консольный инструмент OCR с той же бенгальской моделью за ночь прочитает папку, а OCRmyPDF добавит слой текста для поиска к каждому PDF в ней. Эта страница — для страницы, которая перед вами.

Частые вопросы

Моё изображение где-нибудь сохраняется?

Нет. Языковой пакет загружается с этого сайта при первом использовании языка; само изображение никогда не сохраняется и никуда не отправляется, поэтому всё работает даже с выключенным Wi-Fi.

Насколько хорошо он читает бенгальский?

Печатный бенгальский распространённой гарнитурой — SutonnyMJ, Nikosh, Kalpurush, SolaimanLipi, книга или газета, — сфотографированный ровно и в фокусе, распознаётся хорошо; на размытой или выцветшей странице изредка ошибается лигатура. Ошибки характерны именно для этой письменности: реф или знак гласной на букве, которую модель не видела в такой форме, и мелко напечатанные лигатуры. Чёткий скан в 300 dpi читается лучше фото с телефона, а фото при дневном свете — лучше снятого под лампой дневного света.

Работает ли он с документом в Bijoy?

Да, и это одно из лучших его применений. OCR читает изображение букв, а не кодовые позиции шрифта, поэтому страница, набранная в SutonnyMJ, сразу выходит бенгальским в Unicode — конвертация не нужна. Для файла Word, который всё ещё в Bijoy (текст, а не картинка), лучше взять «Bijoy в Unicode»: он сохраняет оформление и не делает ошибок распознавания.

Почему для бенгальского отдельная страница?

Потому что определение языка отнимает время и ошибается на бенгальском чаще, чем на других письменностях: страница с латинской шапкой, печатью или номером может быть прочитана как английская, и результатом становится уверенная страница бессмыслицы. Когда язык задан до того, как появится картинка, бенгальский пакет начинает загружаться в момент открытия страницы, а распознаватель никогда не примеряет неверный язык. Обычная страница «Распознать текст с картинки» делает ту же работу с включённым определением — для изображений на любом языке.

Распознаёт ли он рукописный текст?

Раздельные печатные буквы — иногда; слитный рукописный текст — нет, ни на бенгальском, ни на любом другом языке, и это верно для любого универсального инструмента OCR. Страница «Распознать рукописный текст» прямо об этом говорит и показывает, что удалось распознать.

А как быть с отсканированным PDF?

Для целого документа используйте «Бенгальский PDF в Word»: он так же читает каждую страницу и выдаёт .docx. Эта страница — для одного изображения.

Полезно знать: Только печатный текст: слитный рукописный текст не распознаётся. Декоративные бенгальские гарнитуры, текст поверх фотографии и сильно выцветшая печать распознаются фрагментарно. Ассамский — отдельный пакет: если страница на ассамском, добавьте его из списка. Результат — простой текст: жирное начертание, цвета и само изображение не переносятся.

Разместите этот инструмент на своём сайте

Бесплатно для любого блога, страницы класса или справочной статьи. Вставьте один фрагмент кода — и посетители смогут пользоваться инструментом прямо на вашей странице.