コンテンツへスキップ

ベンガル語のPDFをWordに変換

通達、フォーム、本の章、スキャンなど、ベンガル語のPDFを編集できる.docxに。結合文字と母音記号は正しい順序で並び、スキャンしたページにはベンガル語に設定したOCRが働きます。何も保存されません。

  • 保存しません
  • 順番待ちなし
  • 登録不要・透かしなし

使い方

1

PDFを追加

テキストのPDFでもスキャンでも。ツールが最初のページを確認し、スキャンならOCRをオンにします。読み取りはすでにベンガル語に設定されています。

2

モードを選ぶ

「編集できるテキスト」は、ページ単位で対応した普通のWord文書になります。「見た目を再現」は、ページの画像の上に各行を元の位置どおりに固定するもので、編集より印刷向きです。

3

変換してダウンロード

見出し、段落、画像、リンクを含む、Unicodeベンガル語フォントの.docxです。

ベンガル語のPDFは何が違うのか

並べ替えこそが要点です。PDFのテキストレイヤーはグリフを描画順で保持しており、ベンガル語のシェーピングエンジンは子音の前に付く母音記号(ি、ে、ৈ)を子音より先に描き、োとৌを子音の両側の2つのグリフに分割します。そのため、単純な抽出ツールから出てくるテキストは、ページに「স্বাভাবিক」とあっても「স্ব␃াভািবক」になります。各行は、ほかの処理の前に論理順に戻されます。母音記号はそのまとまりの後に、レフはその上に乗るまとまりの前にর্として、2つに分かれる母音記号は1つのコードポイントとして。OCRの出力にはこの処理は不要です。エンジンがすでに論理順で出力するからです。

見出し、段落、リンク、画像、改ページは、通常のPDF Word変換のページとまったく同じ方法で判定します。ベースラインが同じ単語は1行になり、間隔が広がると新しい段落になり、本文の1.6倍のサイズの短い行は見出しになり、リンク注釈はWordのハイパーリンクになります。「見た目を再現」はページのアートワークを144 DPIで描画してその上に本物のテキストを配置し、「編集できるテキスト」は読む順番にきれいな段落を作り直します。

ベンガル数字はベンガル数字のまま保たれ、メールアドレスや参照番号など、ページ上のラテン文字の単語はラテン文字のままです。スキャンの場合に読み込まれるのはベンガル語パックなので、英語のレターヘッドが付いたベンガル語のページはベンガル語を正しく読み取る一方、レターヘッドはベンガル文字のような意味不明の文字列になることがあります。英語が重要なら、言語一覧で英語を追加してください。

ほかの目的には

Wordファイルから作られたPDFは、再構築を待っているだけのものです。可能なら.docxをもらってください。また、Bijoyの.docxは、PDFに出力して戻すよりBijoy Unicode変換で変換するほうが確実です。キー入力は1文字も間違えずに変換され、書式も保たれ、ピクセルから読み直すものは何もありません。

スキャンしたベンガル語の本のアーカイブには、ベンガル語モデルを備えたデスクトップのOCRツールがフォルダー全体を一晩で読み取り、OCRmyPDFが見た目を変えずに各PDFへ検索可能なレイヤーを追加します。数百のファイルにはそうしたツールが適した形で、このページは1つのファイルのためのものです。

よくある質問

PDFは保存されますか?

いいえ。何も保存されず、ファイルが残ることはありません。スキャンの場合、読み取りエンジンとベンガル語パックは初回にこのサイトから読み込まれ、次回のために保存されますが、文書そのものがどこかへ送られることはありません。

PDFから取り出したベンガル語は、なぜたいてい綴りがおかしくなるのですか?

PDFはグリフを描かれる順序で記録しており、ベンガル語ではそれが表示順だからです。イ・カールは後に続く子音より前に描かれ、োの2つの部分は子音の両側に置かれます。ほとんどの変換ツールはこの順序をそのまま書き出すため、বাংলাদেশは母音記号が別の文字の前に付いた形で出てきて、すべての単語がスペルチェッカーでは直せない形で誤った綴りになります。この変換ツールは記号をUnicodeが求める位置に戻します。これは、このサイトで作ったものを含め、あらゆるベンガル語PDFに必要な並べ替えです。

Bijoyの文書から作られたPDFも扱えますか?

PDFにSutonnyMJのテキストレイヤーがある場合、ファイルにそう記録されているため、テキストはBijoyのキー入力として出力されます。結果をBijoy Unicode変換に通せば、書式は保たれます。PDFがスキャンなら、OCRが画像を読み取ってそのままUnicodeを出力します。

ベンガル語のスキャンでOCRの精度はどのくらいですか?

印刷されたベンガル語のきれいな300 dpiのスキャンならよく読み取れます。色あせたコピーやスマートフォンの写真では結合文字が失われます。このページでは言語がベンガル語に固定されているため、ラテン文字のレターヘッドや参照番号のせいでページ全体が英語として読み取られることはありません。傾いてスキャンされたページは先にまっすぐに補正します。

どのWord形式で出力されますか?

Word、Google Docs、LibreOfficeで開ける、Unicodeベンガル語フォントで組まれた標準の.docxです。テキストは本物のUnicodeなので、検索でき、AvroやRidmikで入力を続けられます。

表やフォームはどうなりますか?

スキャンの罫線のあるフォームは、「編集できるテキスト」モードで本物のWordの表になります。テキストのPDFの表は、あらゆるPDF Word変換ツールと同じく位置を指定したテキストになります。スプレッドシートが欲しい場合は、PDF Excel変換のほうが適しています。

ご注意: フォントは置き換えられます。.docxにはPDF自身のフォントではなくUnicodeベンガル語フォントが使われるため、見た目は同一ではなく近いものになります。Bijoyフォントで組まれたテキストのPDFはBijoyのキー入力として変換されるため、あとでBijoy Unicode変換が必要です。OCRは写真やロゴを無視し、手書きは画像のまま残し、読み取りに1ページあたり数秒かかります。

このツールをあなたのサイトに設置

ブログ、授業のページ、ヘルプ記事などに無料で設置できます。コードを1つ貼り付けるだけで、訪問者がそのページ上でツールを使えるようになります。