コンテンツへスキップ

スキャンしたPDFを検索できない理由

ファイルの中に文字がないからです。ファイルに実際に何が入っているかを理解すれば、すべての症状の説明がつき、どれだけうまく直せるかを決める1つの設定も見えてきます。

最終確認日:

ファイルの中に文字がない

PDFには、画面上ではまったく同じに見える、まったく別の2種類のものを入れられます。Wordから書き出した文書にはテキスト、つまり位置とフォントを持つ実際の文字が入っています。だから文を選択したり、名前を検索したり、段落をコピーしたりできるのです。スキャンした文書に入っているのはページの写真です。道路標識の写真にピクセルしかないのとまったく同じように、ピクセル以外には何もありません。

すべての症状はこの1つの事実から生じます。検索しても何も見つからないのは、一致するものが何もないからです。テキストを選択できないのは、選択するテキストがないからで、カーソルは代わりに画像の上に四角形を描きます。コピーしても何も得られません。ページ数のわりにファイルが大きいのは、画像は重く文字は軽いからです。そしてWordに変換すると、空の文書か、画像が貼り付けられた文書ができあがります。

簡単な確認方法:マウスで単語を1つ選択してみてください。テキストカーソルが表示されて単語がハイライトされれば、本物のテキストがあります。四角形が表示されたら、それは画像です。

OCRが実際に追加するもの

OCR(光学文字認識)は、画像の中の形を読み取り、それがどの文字かを判断します。役に立つのはその次の段階で、認識した単語が画像内の単語の上に重なる透明なテキストとしてPDFに書き戻されます。見た目は何も変わっていないのでページは元のままですが、検索、選択、コピー、インデックス登録ができるようになります。

これは意図的に控えめな設計で、文書にとってはそれが正解です。何も組み直されないので、契約書は署名されたときの見た目のままで、元のスキャン画像が視覚的な記録として残ります。PDF OCRは1回の処理でこれを行い、たいていはページの傾きや向きも直します。読み取るためにどのみちそれが必要だからです。

検索できる文書ではなく編集できる文書が欲しいなら、それは別の、はるかに難しい作業です。テキストを抽出し、レイアウトを推測し、段落や表として組み立て直す必要があります。PDF Word変換はそれを行いますが、テキストレイヤーとは違い、結果は必ず確認が必要です。

すべてを決める設定:300 DPI

認識精度はソフトウェアよりもスキャンの質にはるかに大きく左右され、最も重要な数値は解像度です。300 DPIが標準で、これには根拠があります。普通の本文の文字の高さに約30ピクセルが割り当てられ、似た形の文字を区別するのに必要な最低限を十分に上回るのです。

150 DPIでは精度が目に見えて落ち、しかも厄介な種類の誤りが出ます。1がl、5がS、rnがmと読まれるといった誤りです。それより低いと急速に悪化します。300を超えてもほとんど効果はなく、ファイルがずっと大きくなります。600 DPIにする価値があるのは、非常に小さな文字や状態の悪い原本の場合だけです。

ほかにも、ほぼ同じくらい重要な撮影・取り込みの設定が3つあります。白黒ではなくグレースケール。単純な2値化では文字の細い部分が消えてしまうからです。センサーに対して平らでまっすぐ。斜めから撮影したページは、ページ内の位置によって文字の形が変わってしまうからです。そして均一な照明。上から撮影するときに自分の影がページに落ちるのが、典型的な失敗例です。

どのOCRでも読めないもの

ここを正直に知っておけば、大幅に時間を節約できます。続け字の手書き文字は、汎用のOCRでは認識されません。これは努力の問題ではなく構造上の理由によるものです。活字の読み取りは文字と文字の境界を見つけることで成り立っていますが、筆記体には境界がありません。1文字ずつ書いた手書き文字、ブロック体の大文字、記入欄に書いた文字は、すき間で区切られた独立した形なので、うまく読めることがよくあります。

写真の一部になっている文字、たとえば看板や商品の上の文字、ごちゃごちゃした背景の上の文字は、紙の上の文字よりはるかに難しく、装飾の強い書体はさらに難しくなります。コピーを重ねたコピーでは、文字を区別する細い線が失われます。また、スタンプや書き込み、マーカーのある文書は、それらが文字に重なっている部分で読み取りが悪くなります。

良いツールはどれくらい確信があったかを示してくれます。その数値は活用するためにあります。文脈から読める文の途中で確信度が低くても大した問題ではありませんが、口座番号の数字の確信度が低いのは重大です。危険なのは確信を持って間違えた誤りです。何も警告してくれないからです。

便利さ以上に重要な理由

テキストレイヤーのないスキャン文書のアーカイブは、実質的に失われたも同然です。検索もインデックス登録もできず、コンプライアンスのシステムが名前を探すこともできず、スクリーンリーダーで読み上げることもできません。そのため多くの法域では、それを公開することは不便というより法的な問題になります。

だからこそ、最初から適切な設定でスキャンすることにはこだわる価値があります。箱いっぱいの書類をスキャンし直すのは、最初に一度きちんとスキャンするよりはるかにコストがかかり、取り込まれなかった細部はどんな処理でも取り戻せません。

よくある質問

OCRの精度は実際どのくらいですか?

普通の印刷文字をきれいに300 DPIでスキャンしたものなら、非常に高精度です。誤りは日常的ではなく、たまに起こる程度です。暗い場所で斜めから撮ったスマートフォンの写真では、劇的に悪くなります。ソフトウェアの選択よりスキャンの質のほうがはるかに重要です。

OCRで文書の見た目は変わりますか?

いいえ。認識したテキストは既存の画像の上に透明な状態で追加されるので、ページの見た目は元のままです。処理の一環として、ページの傾きや向きは通常補正されるため、曲がったスキャンは見た目が変わるというより良くなります。

OCRの後でテキストを編集できますか?

PDF上ではできません。見えているページは画像のままで、テキストレイヤーはその上に透明な状態で重なっているだけです。編集できるものが必要なら、認識済みの文書をWordに変換し、結果を確認することを前提にしてください。

OCRは手書き文字にも使えますか?

1文字ずつ離して書いた手書き文字や、記入済みのフォームはうまくいくことがよくあります。続け字は、どの汎用OCRツールでも読めません。文字がつながっていて、見つけるべき境界がないからです。手書き文字専用に学習したツールならもっとうまく読めますが、その代わりページを第三者に送ることになります。

検索可能にしたPDFがずっと大きくなったのはなぜですか?

本来ほとんど変わらないはずです。テキストレイヤーは1ページあたり数キロバイトだからです。大きく増えた場合は、ページがそのまま保持されずに描画し直された可能性があり、確認する価値があります。テキストレイヤーの意義は、元の画像に手を加えずに残すことだからです。