Перейти к содержимому

Извлечь текст из картинки

Считайте слова с фотографии, скана или скриншота и получите их в виде текста, который можно редактировать, искать и вставлять. Изображение не сохраняется.

  • Не сохраняется
  • Без очереди и ожидания
  • Без регистрации и водяных знаков

Как это работает

1

Добавьте изображение

JPG, PNG, WebP, GIF, BMP, HEIC с iPhone или TIFF со сканера. Перед распознаванием снимок, сделанный под углом, выпрямляется, а освещение выравнивается.

2

Проверьте язык

Письменность определяется по изображению, и язык выбирается за вас. Если догадка оказалась неверной или на картинке несколько языков, доступно более 120.

3

Скопируйте или скачайте

Сохраните вёрстку — строки и столбцы на своих местах — или объедините строки в сплошные абзацы, готовые к вставке в другое место.

Как распознаётся изображение

Нужный распознавателю размер измеряется по тексту, а не по файлу. Высота строки оценивается по самому изображению, и всё масштабируется так, чтобы строка занимала около тридцати четырёх пикселей: маленький скриншот увеличивается до четырёх раз, а огромная фотография уменьшается, причём длинная сторона в любом случае ограничена. Поэтому девятимегапиксельное фото меню распознаётся не точнее, чем чёткое маленькое, а изображение меньше примерно трёхсот пикселей по короткой стороне вообще пропускает определение языка и читается как латиница. Перед этим фон бумаги под текстом оценивается по участкам и вычитается, чтобы выровнять освещение, наклон страницы измеряется по всей её высоте и исправляется поворотом, а результат переводится в чёрно-белый по единому общему порогу.

Выбор языка — это прослушивание, а не поиск по таблице, потому что обычный детектор языки не определяет. Первый проход сообщает только письменность и поворот, ничего больше; письменность сужает круг, языковые настройки вашего браузера решают спор между языками с общей письменностью, а затем каждый кандидат действительно используется для распознавания уменьшенной копии изображения и оценивается по количеству уверенно распознанных слов. Победитель читает настоящую страницу, а распознанный текст проверяется ещё раз — по диакритическим знакам, характерным сочетаниям букв, частым коротким словам, — чтобы понять, не справится ли другой язык лучше. Именно этот механизм стоит за правилом «неверно указанный язык даёт уверенно пустую страницу»: прослушивание существует затем, чтобы догадка проверялась на вашем изображении, а не просто утверждалась.

Об одном стоит знать заранее — о том, что попадает в результат. Абзац, в котором распознаватель не уверен, отбрасывается, а не показывается, так что текст, который вы видите на изображении, может полностью отсутствовать в результате, а не появиться в виде бессмыслицы. То же касается блоков, которые распознаватель счёл картинкой или шумом, и отдельных отметок без единой буквы или цифры. Для обычных слов с низкой уверенностью никакого отсечения нет, поэтому ошибки внутри абзаца остаются, и найти их — ваша задача. Если показатель уверенности приличный, а куска страницы просто нет, произошло именно это.

Если нужно другое

Ничего не сохраняется, но это единственный инструмент на сайте, где первый запуск не бесплатен: сам распознаватель весит несколько мегабайт, а каждый языковой пакет — ещё от одного до пяти; они загружаются с этого сайта и затем хранятся до следующего раза. Ради одной страницы подождать стоит, а ради двух тысяч сканов по расписанию — нет: для этого есть настольный инструмент OCR, например OCRmyPDF, который добавляет текстовый слой ко всей папке одной командой, без загрузок и кликов.

Три вещи здесь просто не делаются, и лучше знать о них заранее, чем обнаружить на практике. Перспектива не исправляется: поворот страницы измеряется и выравнивается, но снимок, сделанный сбоку, сохраняет форму трапеции, поэтому снимать строго сверху стоит лишней секунды. Порог, отделяющий текст от бумаги, — одно значение на всё изображение, а не своё для каждой области, поэтому на странице, наполовину в тени, тёмная половина потеряется даже после выравнивания освещения; лучше переснять её при ровном свете, чем бороться. А у таблицы, свёрстанной пробелами, а не линиями, нет линий, которые можно найти, поэтому она читается как колонки текста и переживает вставку в таблицу лишь по счастливой случайности.

Частые вопросы

Насколько точно распознавание?

На чётком печатном тексте, сфотографированном ровно и в фокусе, — очень точно: несколько символов на тысячу. Точность падает при размытии, бликах, низком контрасте и необычных шрифтах, и страница показывает, насколько уверен был распознаватель, а не заставляет вас гадать. Если показатель низкий, проблема обычно в снимке: больше света, меньше наклона и текст на весь кадр решают большую часть проблем.

Моё изображение где-нибудь сохраняется?

Нет. Языковой пакет загружается с этого сайта при первом использовании языка; само изображение никогда не сохраняется и никуда не отправляется, поэтому всё работает даже с выключенным Wi-Fi.

Какие языки поддерживаются?

Более 120, в том числе английский, бенгальский, хинди, урду, арабский, испанский, французский, немецкий, португальский, русский, китайский, японский и корейский. Письменность определяется по самому изображению; если одной письменностью пользуются несколько языков — латиница, кириллица, арабское письмо, деванагари, — выбор решают языковые настройки вашего браузера, и его всегда можно изменить.

Сохранятся ли столбцы и таблица?

Да, если вы об этом попросите. Таблицы с линиями находятся и распознаются по ячейкам, так что подпись не сливается со значением, и возвращаются в виде строк, разделённых табуляцией, которые вставляются прямо в таблицу. Текст в колонках читается в порядке чтения, а не поперёк страницы. Если же выбрать объединение строк, эта структура намеренно отбрасывается — это то, что нужно для абзаца, который вы собираетесь переформатировать.

Распознаёт ли он рукописный текст?

Аккуратные раздельные печатные буквы — например, заглавные в анкете — часто распознаются. Слитный рукописный текст — нет, ни здесь, ни в любом другом универсальном инструменте OCR; честный ответ: это другая задача, для которой нужен другой подход. Для рукописного текста есть отдельная страница, которая прямо об этом говорит и показывает, что удалось распознать.

Какие форматы изображений поддерживаются?

JPG, PNG, WebP, GIF, BMP и SVG — средствами самого браузера, а также HEIC с iPhone и TIFF со сканера. Снимок, сделанный телефоном в портретной ориентации, получается правильно повёрнутым, потому что сначала применяется флаг ориентации, записанный камерой.

Почему некоторые слова распознаны неправильно?

Почти всегда дело в снимке, а не в тексте: блик на странице, тень от руки, дрожание камеры или текст на экране настолько мелкий, что каждая буква — это горстка пикселей. Распознаватель получает изображение, масштабированное до оптимального для него размера, освещение предварительно выравнивается, но никакая обработка не создаст детали, которые камера не запечатлела.

Есть ли ограничение по размеру?

Только объём памяти вашего устройства. Ничего не сохраняется, поэтому серверного лимита нет. Очень большая фотография уменьшается до того, что распознаватель может использовать, — после определённого порога лишние пиксели добавляют только нагрузку, а не точность.

Полезно знать: Слитный рукописный текст надёжно не распознаёт ни один универсальный инструмент OCR, включая этот. Текст поверх картинки, сильно стилизованные шрифты и очень низкий контраст распознаются фрагментарно. Результат — простой текст: шрифты, цвета, жирное и курсивное начертание не переносятся, как и само изображение.

Разместите этот инструмент на своём сайте

Бесплатно для любого блога, страницы класса или справочной статьи. Вставьте один фрагмент кода — и посетители смогут пользоваться инструментом прямо на вашей странице.