コンテンツへスキップ

スキャンしたPDFを検索可能に

スキャン画像から文字を読み取り、ページの上に見えない形で重ねます。見た目は変わらず、検索・選択・コピーができるようになります。斜めや横向きにスキャンされたページもまっすぐに直します。

  • 保存しません
  • 順番待ちなし
  • 登録不要・透かしなし

使い方

1

スキャンしたPDFを追加

ファイルをドロップします。すでにテキストレイヤーがあるかどうかを確認し、OCRをかけると逆効果になる場合はお知らせします。

2

言語を確認

最初のページを読み取り、見つかった言語を表示します。自分で選ぶ必要があれば、120以上の言語から選べます。

3

ダウンロード

同じ文書に、スキャン画像の裏に隠れたテキストレイヤーが加わったものが手に入ります。

変わらないページの上に、見えないレイヤーを1枚

スキャン画像は元のまま残します。加えるのは、見えない描画モードで描いたテキストのレイヤーです。本物の文字を、画像の中の単語の上に1語ずつ配置し、決して描画されないように指定しています。見た目としては何も変わっていないので、ページはまったく同じに見えます。文章を選択すると、見えないテキストが目に見える文字と同じ位置にあるので、ハイライトは正しい単語に重なります。これは検索可能なスキャンPDFを作る標準的な方法で、結果が文書の写真でありながら、検索・コピー・インデックス化ができるのはこのためです。

ページについて2つの点を意図的に補正します。どちらも読み取りのためにいずれ必要な処理だからです。横向きにスキャンされたページは正しい向きに回転し、スキャナーに斜めに送られたページはまっすぐに直します。そのため、出力は入力よりきれいになることがよくあります。ページサイズは統一せずに元のPDFのものを保つので、ページサイズが混在した文書はそのままで、縮尺も変わりません。

精度はほぼスキャン次第で、その差は小さくありません。印刷された文字を300 dpiできれいにスキャンすれば非常に高い精度で読み取れますが、同じページでも150 dpiでは目に見えて悪くなります。暗い場所で斜めから撮った写真となると、まったく別物です。スキャンを自分で行うなら、効いてくる設定はグレースケールの300 dpiです。それ以上の解像度はほとんど役に立たず、それ以下にするとすぐに悪化します。小さな文字、詰まった行間、色の付いた背景、コピーを重ねたコピー、スタンプや手書きの入ったものは、どれもソフトウェアでは完全に解決できない難しさがあります。

何を意図的に除くかは、何を入れるかと同じくらい重要です。写真、ロゴ、署名、装飾的なグラフィックは読み取らずに無視します。画像から無理に文字を引き出すと、もっともらしい無意味な文字列ができあがり、それがあらゆる検索に出てきてしまうからです。中国語、日本語、韓国語の単語は認識はしますが、それを表現できるフォントが提供されるまでは、空白として書き込む代わりにテキストレイヤーから除き、件数をお知らせします。このツールは文書を組み直すわけではありません。ページ上の文字は画像のままで、編集できるテキストにしたいならWordへの変換を使ってください。

ほかの目的には

このページが手軽さで寄り添っている本家のツールがOCRmyPDFで、無料です。ocrmypdf --deskew --rotate-pages in.pdf out.pdfは同じ処理をより細かく制御して行え、--optimize 3で結果を小さくし、--redo-ocrで質の悪い既存のテキストレイヤーを置き換え、--output-type pdfaで長期保存用のファイルを同時に作れます。数千ページにも対応し、フォルダーを監視して自動処理でき、図書館や文書アーカイブで実際に使われているのはこのツールです。

歴史的な印刷物、変わったレイアウト、表の多い文書など難しい資料には、Google、Amazon、Microsoftのクラウドサービスのほうが、汎用の文字認識では読めないページを読み取れます。はるかに多くの資料で学習しているからです。これは本物の能力差で、知っておく価値があります。ただしそれは、文書を第三者に送ることを意味します。このページはまさにその引き換えを避けるために存在しています。壊れやすい古い本には適した選択でも、医療記録の箱には不適切な選択です。

よくある質問

処理後にページの見た目は変わりますか?

まっすぐになるだけです。1度傾いてスキャンされたページや横向きのページは、正しい向きに直します。スキャン画像そのものはそのまま残し、読み取った文字を見えないインクでその上に重ねます。描画も印刷もされません。変わるのは、Ctrl+Fで検索できるようになることです。

文書はどこかに保存されますか?

いいえ。文字認識の処理では何も保存されません。読み取りエンジンと言語パックは、その言語を初めて使うときにこのサイトから読み込まれます。文書そのものがお使いの端末から出ることはありません。

精度はどのくらいですか?

印刷された文字をきれいにスキャンしたものなら、非常に高い精度です。ぼやけた写真、手書き、珍しいフォントでは精度が下がります。傾きは読み取る前に補正します。罫線のある表はセルごとに読み取るので、フォームの項目名が値とつながってしまうことはありません。

どの言語に対応していますか?

英語、ベンガル語、ヒンディー語、ウルドゥー語、アラビア語、スペイン語、フランス語、中国語、日本語、韓国語など、120以上の言語です。文字体系はページから判別します。同じ文字体系を使う言語が複数ある場合は、ブラウザの言語設定で判断し、あとから変更することもできます。

テキストレイヤーに一部の単語が入っていません。なぜですか?

テキストレイヤーには、同梱のフォントで書ける文字しか入れられません。ベンガル文字、デーヴァナーガリー文字、アラビア文字、タイ文字など20数種類の文字体系には専用のフォントがありますが、中国語、日本語、韓国語にはまだありません。そのため、これらの単語は空白として保存するのではなく、件数をお知らせしています。PDF Word変換をOCRありで使えば、そのテキストをすべて取得できます。

どのくらい時間がかかりますか?

1ページあたり数秒です。サーバー群ではなく、お使いの端末そのものが読み取りを行っているためです。進み具合はページごとに表示されます。

ご注意: 中国語、日本語、韓国語の単語は、対応フォントが提供されるまではテキストレイヤーに入れず、空白として保存する代わりに件数をお知らせします。読み取りエンジンが扱えるそれ以外の文字体系はすべて書き込まれます。写真、ロゴ、署名は意味のない文字にならないよう無視します。手書き文字は、汎用のOCRツールではどれも確実には認識できません。

このツールをあなたのサイトに設置

ブログ、授業のページ、ヘルプ記事などに無料で設置できます。コードを1つ貼り付けるだけで、訪問者がそのページ上でツールを使えるようになります。