Распознать бенгальский текст с картинки
Наведите на фото страницы, скан или скриншот — и получите бенгальский текст в Unicode: его можно искать, редактировать и вставлять. Распознаватель настроен на бенгальский ещё до того, как появится картинка, поэтому ничего не нужно определять и выбирать. Ваше изображение никогда не сохраняется.
- Не сохраняется
- Без очереди и ожидания
- Без регистрации и водяных знаков
Как это работает
Добавьте изображение
Фото страницы книги, старый циркуляр, отсканированный сертификат или скриншот бенгальского текста. Подходят JPG, PNG, WebP, HEIC и TIFF; снимок, сделанный под углом, сначала выпрямляется.
Дайте ему прочитать
Бенгальский уже выбран. Если на странице есть и английский — бланк, шапка письма, — добавьте его из списка, и будут распознаны оба языка.
Скопируйте как Unicode
Текст получается в Unicode, каким бы шрифтом ни был напечатан оригинал: циркуляр в SutonnyMJ читается как обычный бенгальский, а не как "evsjv‡`k". Сохраните вёрстку или объедините строки, затем скопируйте или скачайте.
Как бенгальский влияет на распознавание
Бенгальская модель читает кластеры, а не отдельные буквы. Лигатура вроде ক্ষ или ন্ত্র — это одна фигура на странице, и модели нужно решить и что это, и как это раскладывается в Unicode, — вот почему ошибка в бенгальском обычно даёт неверную лигатуру или знак гласной не на той букве, а не просто неверную букву. Результат выдаётся в том порядке, какого ожидает Unicode: знак гласной следует за своим кластером согласных, реф записывается как র + хасанта перед кластером, на котором стоит, а двухчастные гласные выходят одной кодовой позицией. Именно такого порядка ждут любое поле поиска, проверка орфографии и шрифт, и он противоположен визуальному порядку, в котором работает наборщик в Bijoy.
Всё, что делает обычный распознаватель, делается и здесь: освещение бумаги выравнивается, страница выпрямляется, таблицы с линиями читаются по ячейкам, чтобы подпись не слилась со значением, а результат возвращается либо в вёрстке страницы, либо объединённым в абзацы. Числа читаются бенгальскими цифрами, если напечатаны бенгальскими цифрами; бланк, в котором смешаны ০১২ и 012, сохраняет и те и другие.
Бенгальский не делит свою модель ни с одним другим языком, но на картинке всё же может быть английский — шапка бланка, номер документа, блок подписи, — и один язык читает другой как бессмыслицу. Если добавить английский из списка, страница читается обоими пакетами, и каждое слово остаётся в той письменности, в какой было напечатано.
Если нужно другое
Документ в Bijoy, который всё ещё существует как файл, лучше конвертировать, чем фотографировать. OCR восстанавливает текст по пикселям и даже на лучшей странице ошибается в нескольких символах из тысячи; конвертер «Bijoy в Unicode» восстанавливает его по нажатиям клавиш, не ошибается вовсе и сохраняет жирное начертание и таблицы. Фотографируйте страницу, только если файла больше нет.
Для целой книги или архива сканов правильная форма инструмента — настольная: консольный инструмент OCR с той же бенгальской моделью за ночь прочитает папку, а OCRmyPDF добавит слой текста для поиска к каждому PDF в ней. Эта страница — для страницы, которая перед вами.
Частые вопросы
Моё изображение где-нибудь сохраняется?
Нет. Языковой пакет загружается с этого сайта при первом использовании языка; само изображение никогда не сохраняется и никуда не отправляется, поэтому всё работает даже с выключенным Wi-Fi.
Насколько хорошо он читает бенгальский?
Печатный бенгальский распространённой гарнитурой — SutonnyMJ, Nikosh, Kalpurush, SolaimanLipi, книга или газета, — сфотографированный ровно и в фокусе, распознаётся хорошо; на размытой или выцветшей странице изредка ошибается лигатура. Ошибки характерны именно для этой письменности: реф или знак гласной на букве, которую модель не видела в такой форме, и мелко напечатанные лигатуры. Чёткий скан в 300 dpi читается лучше фото с телефона, а фото при дневном свете — лучше снятого под лампой дневного света.
Работает ли он с документом в Bijoy?
Да, и это одно из лучших его применений. OCR читает изображение букв, а не кодовые позиции шрифта, поэтому страница, набранная в SutonnyMJ, сразу выходит бенгальским в Unicode — конвертация не нужна. Для файла Word, который всё ещё в Bijoy (текст, а не картинка), лучше взять «Bijoy в Unicode»: он сохраняет оформление и не делает ошибок распознавания.
Почему для бенгальского отдельная страница?
Потому что определение языка отнимает время и ошибается на бенгальском чаще, чем на других письменностях: страница с латинской шапкой, печатью или номером может быть прочитана как английская, и результатом становится уверенная страница бессмыслицы. Когда язык задан до того, как появится картинка, бенгальский пакет начинает загружаться в момент открытия страницы, а распознаватель никогда не примеряет неверный язык. Обычная страница «Распознать текст с картинки» делает ту же работу с включённым определением — для изображений на любом языке.
Распознаёт ли он рукописный текст?
Раздельные печатные буквы — иногда; слитный рукописный текст — нет, ни на бенгальском, ни на любом другом языке, и это верно для любого универсального инструмента OCR. Страница «Распознать рукописный текст» прямо об этом говорит и показывает, что удалось распознать.
А как быть с отсканированным PDF?
Для целого документа используйте «Бенгальский PDF в Word»: он так же читает каждую страницу и выдаёт .docx. Эта страница — для одного изображения.
Полезно знать: Только печатный текст: слитный рукописный текст не распознаётся. Декоративные бенгальские гарнитуры, текст поверх фотографии и сильно выцветшая печать распознаются фрагментарно. Ассамский — отдельный пакет: если страница на ассамском, добавьте его из списка. Результат — простой текст: жирное начертание, цвета и само изображение не переносятся.
Разместите этот инструмент на своём сайте
Бесплатно для любого блога, страницы класса или справочной статьи. Вставьте один фрагмент кода — и посетители смогут пользоваться инструментом прямо на вашей странице.
Похожие инструменты
Распознать текст с картинки
Текст с изображения на 120+ языках
Бенгальский PDF в Word
Бенгальские PDF в редактируемый .docx, сканы тоже
Bijoy в Unicode
Прочитайте текст в SutonnyMJ как настоящий бенгальский
Распознать текст в PDF
Скан станет доступным для поиска
Текст со скриншота
Вставьте скриншот — получите текст
Распознать рукописный текст
Печатные буквы от руки, честно распознанные