画像から文字を取り出す
写真、スキャン、スクリーンショットから文字を読み取り、編集・検索・貼り付けができるテキストとして取り出せます。画像は保存されません。
- 保存しません
- 順番待ちなし
- 登録不要・透かしなし
使い方
画像を追加
JPG、PNG、WebP、GIF、BMP、iPhoneのHEIC、スキャナーのTIFFに対応。斜めに撮った写真は、読み取る前に傾きを補正し、明るさを均一にします。
言語を確認
画像から文字体系を読み取り、言語を自動で選びます。判別が間違っていた場合や、複数の言語が含まれる場合は、120以上の言語から選べます。
コピーまたはダウンロード
行や段組みを元の位置のままにしてレイアウトを保つか、行をつなげて、ほかの場所に貼り付けやすい段落にできます。
画像の読み取り方
読み取りに適したサイズは、ファイルではなく文字のインクから測ります。画像そのものから1行の文字の高さを推定し、1行がおよそ34ピクセルになるように全体を拡大縮小します。小さなスクリーンショットは最大4倍に拡大され、巨大な写真は縮小されます。どちらの場合も長辺には上限があります。900万画素で撮ったメニューの写真が、小さくても鮮明な写真より正確にならないのはこのためです。また、短辺がおよそ300ピクセル未満の画像は言語の判別をまったく行わず、ラテン文字として読み取られます。その前に、インクの背景にある紙の明るさを区画ごとに推定して取り除くことで明るさを均一にし、ページ全体の高さにわたって傾きを測ってまっすぐに回転させ、最後に全体で1つのしきい値を使って白黒に変換します。
言語の選択は、一覧から引くのではなく「オーディション」で行います。一般的な判別器は、実は言語を判別しないからです。最初の処理でわかるのは文字体系と回転だけです。文字体系で候補を絞り、同じ文字体系を使う言語の間ではブラウザの言語設定で優先順位を決めます。そのうえで各候補の言語を使って縮小版の画像を実際に読み取り、確信を持って読めた単語の数で採点します。勝ち残った言語で本番のページを読み取り、認識したテキストをもう一度調べます。発音区別符号、特徴的な文字の組み合わせ、よく使う短い単語などから、別の言語のほうがうまくいくかどうかを確認するのです。「間違った言語を指定すると、自信満々の空白ページが返ってくる」という現象の裏にあるのがこの仕組みです。オーディションは、推測をただ主張するのではなく、実際の画像で試すために存在します。
出力に何が残るかについて、知っておきたいことが1つあります。読み取りに自信が持てなかった段落は、表示されずに削除されます。そのため、画像では見える文字が、意味不明な文字列として出るのではなく、結果からまるごと消えていることがあります。画像やノイズと判定されたブロックや、文字も数字も含まない孤立した記号も同様です。段落内の普通の低確信度の単語は削除しないので、段落内の誤読は残ります。見つけて直すのはあなたです。確信度の数値はそこそこなのに、ページの一部がすっぽり抜けている場合は、これが起きています。
ほかの目的には
何も保存されませんが、このサイトで唯一、初回が「タダ」ではないツールです。読み取りエンジン本体が数MB、言語パックがそれぞれ1〜5 MBあり、このサイトから読み込んだあと、次回のために保存されます。1ページなら待つ価値がありますが、2,000枚のスキャンを定期的に処理するならその価値はありません。その場合はOCRmyPDFのようなデスクトップのOCRツールを使いましょう。コマンド1つでフォルダー全体にテキストレイヤーを追加でき、ダウンロードもクリックも不要です。
ここでは3つのことをまったく行いません。事前に知っておくほうが、自分で気づくより早く済みます。まず、遠近の歪みは補正しません。ページの回転は測ってまっすぐにしますが、横から撮った写真は台形のままなので、真上から撮る一手間をかける価値があります。次に、インクと紙を分けるしきい値は、領域ごとではなく画像全体で1つの値です。そのため、半分が影になったページは、明るさを均一にしても暗い側が失われます。無理に対処するより、均一な光で撮り直してください。最後に、罫線ではなくスペースで配置された表には検出できる罫線がないため、段組みの文章として読み取られ、スプレッドシートに貼り付けてうまくいくかは運次第です。
よくある質問
精度はどのくらいですか?
印刷されたはっきりした文字を、正面からピントを合わせて撮影したものなら、非常に高精度です。誤りは1,000文字に数文字程度です。ぼやけ、光の反射、低いコントラスト、珍しい書体があると精度は下がります。ページには読み取りの確信度が表示されるので、推測する必要はありません。数値が低い場合は、たいてい画像に原因があります。明るくする、角度をなくす、文字で画面をいっぱいにする、の3つでほとんど改善します。
画像はどこかに保存されますか?
いいえ。言語パックはその言語を初めて使うときにこのサイトから読み込まれます。画像そのものは保存されず、どこにも送信されないので、Wi-Fiをオフにしても動作します。
どの言語を読み取れますか?
英語、ベンガル語、ヒンディー語、ウルドゥー語、アラビア語、スペイン語、フランス語、ドイツ語、ポルトガル語、ロシア語、中国語、日本語、韓国語など、120以上の言語です。文字体系は画像そのものから判別します。ラテン文字、キリル文字、アラビア文字、デーヴァナーガリー文字のように複数の言語が同じ文字体系を使う場合は、ブラウザの言語設定で決まります。言語はいつでも変更できます。
段組みや表は保たれますか?
はい、指定すれば保たれます。罫線のある表は検出してセルごとに読み取るので、項目名と値が混ざりません。結果はタブ区切りの行になり、そのままスプレッドシートに貼り付けられます。段組みされた文章は、横にまっすぐではなく読む順番どおりに読み取ります。行をつなげる設定を選ぶと、この構造はあえて破棄されます。これから段落を流し込み直す場合には、そのほうが便利です。
手書き文字は読み取れますか?
用紙に書かれたブロック体の大文字のような、丁寧で1文字ずつ離れた活字体なら、読み取れることがよくあります。続け字の筆記体は、ここでもほかの一般的なOCRツールでも読み取れません。正直に言うと、これは別のアプローチが必要な別の問題です。手書き用のページを別に用意しており、そこではこの点をはっきり説明し、読み取れた結果を表示します。
どの画像形式に対応していますか?
ブラウザ自体が扱えるJPG、PNG、WebP、GIF、BMP、SVGに加え、iPhoneのHEICとスキャナーのTIFFに対応しています。スマホで縦向きに撮った写真も、カメラが記録した向きの情報を最初に適用するので、正しい向きで読み取られます。
一部の単語を間違えたのはなぜですか?
ほとんどの場合、原因は文字ではなく画像にあります。ページに映り込んだ光の反射、手の影、手ぶれ、あるいは画面上の文字が小さすぎて1文字が数ピクセルしかない、といったことです。読み取り前に、画像は読み取りに最適なサイズに拡大縮小され、明るさも均一にされますが、どんなに処理してもカメラが捉えなかった細部は生み出せません。
サイズの上限はありますか?
お使いの端末のメモリだけです。何も保存しないので、サーバー側の上限はありません。非常に大きな写真は、読み取りに使えるサイズまで縮小されます。ある程度を超えると、ピクセルが増えても負荷が増えるだけで精度は上がりません。
ご注意: 続け字の手書き文字は、このツールを含め、どの一般的なOCRツールでも確実には認識できません。画像の上に印刷された文字、装飾の強い書体、非常に低いコントラストでは、結果が部分的になります。結果はプレーンテキストです。書体、色、太字、斜体は引き継がれず、画像そのものも含まれません。
このツールをあなたのサイトに設置
ブログ、授業のページ、ヘルプ記事などに無料で設置できます。コードを1つ貼り付けるだけで、訪問者がそのページ上でツールを使えるようになります。