PDFをWordに変換
どんなPDFも編集できるWord文書に。画像もそのまま、元のページを再現する「見た目を再現」モードと、スキャン向けのOCR(文字認識)も内蔵。何も保存されず、ファイルが残ることはありません。
- 保存しません
- 順番待ちなし
- 登録不要・透かしなし
使い方
PDFを追加
PDFをページにドロップします。ツールが自動でチェックし、スキャンだと判断するとOCRをオンにします。
モードを選ぶ
初期設定の「編集できるテキスト」は、PDFとページ単位で対応した普通のWord文書になります。段落、見出し、太字と斜体、リンク、画像を含み、各ページは元のサイズで、それぞれの余白と行間も保たれるので、PDFの12ページ目は文書でも12ページ目です。ファイルサイズはPDFと同程度です。「見た目を再現」は、ページの画像の上に各行を元の位置どおりに固定します。印刷用にPDFをそっくり再現しますが、編集しにくく、ファイルサイズは数倍になります。スキャンの場合はOCRが自動でオンになり、最初のページから言語を判別し、傾いてスキャンされたページもまっすぐに補正します。
変換してダウンロード
「Wordに変換」をクリックすると、見出しと段落の整った.docxをダウンロードでき、すぐに編集できます。
きれいに変換できるもの、できないもの
PDFが記録しているのは、座標上のグリフ(文字の形)です。段落はなく、誰かが意図的にタグ付けしていない限り見出しもありません。そのため、どちらも読み取るのではなく推定します。ベースラインが同じ単語は1行になり、縦の間隔が広がると新しい段落になります。文書の本文の中央値のおよそ1.6倍のサイズで組まれた短い行は見出し1、1.3倍なら見出し2になります。この最後の規則は、編集を始める前に知っておく価値があります。見出しが太字でも本文より大きくない文書は本文として取り込まれ、Wordのナビゲーションウィンドウは空になります。
意外に思われますが、リンクは残ります。テキストに重なるリンク注釈は本物のWordのハイパーリンクになり、12ページ目に飛ぶ目次の項目や相互参照は、そのページの先頭に置いたブックマークへの内部リンクになります。そのため、変換後も目次がちゃんと機能します。
まったく読み取らないものが2つあります。入力済みのPDFフォームの回答は、ページではなく入力欄オブジェクトの中にあるため、「編集できるテキスト」には含まれません。「見た目を再現」ではページの画像の一部なので表示されますが、編集できるテキストにはなりません。コメントやスタンプも同じ種類のオブジェクトで、同じ扱いになります。また「見た目を再現」では、アートワークを144 DPIで1回描画し、その上に本物のテキストを配置します。そのため、PDFではベクターだったロゴやグラフも.docxでは画像になり、拡大するとそれが分かります。
ほかの目的には
Word文書ではなく文字そのものが欲しいなら、Popplerのpdftotext -layout file.pdfのほうが速く、結果も予測しやすく、スペースで段組みを保ちます。PDFをほかの処理に渡す一般的な方法でもあります。また、そもそもPDFがWordファイルから作られたものなら、作成者に.docxを頼んでください。元に戻す変換はすべて座標からの再構築であり、そうでない唯一のコピーは元のファイルです。
表は、このツールも含め、あらゆるPDF変換ツールの弱点です。ほとんどが表で数値が重要な文書なら、TabulaやCamelotが無料で、その問題だけのために作られており、汎用の変換ツールより良い結果が出ます。
よくある質問
変換するときにPDFは保存されますか?
いいえ。どちらの変換モードでも何も保存されず、ファイルが残ることはありません。OCRを使う場合、読み取りエンジンと言語パックは初回にこのサイトから読み込まれますが、文書そのものがどこかへ送られることはありません。
スキャンしたPDFや文書の写真も変換できますか?
はい。OCRをオンにすると(スキャンを検出するとツールが自動で提案します)、ページの画像から文字を読み取ります。言語はページから判別され、英語、ベンガル語、ヒンディー語、ウルドゥー語、アラビア語、スペイン語、中国語を含む120以上の言語に対応しています。判別が違っていたら自分で選ぶこともできます。罫線のあるフォームは、「編集できるテキスト」モードで本物のWordの表になります。
OCRの精度はどのくらいですか?
印刷された文字のきれいなスキャンなら、精度は非常に高くなります。ぼやけた写真、手書き、珍しいフォントでは精度が下がります。鮮明で、まっすぐで、明るく撮れたスキャンが最もよい結果になります。
書式や画像は保たれますか?
はい。「見た目を再現」は各ページを元のサイズのまま2層で作り直します。写真、ロゴ、色の帯、ベクターのアートワークはPDFが描くとおりに正確に再現され、その上に本物のテキストが、元の位置、元の色、太字、見出しのまま重なります。「編集できるテキスト」は、きれいな段落と見出しを作り直し、画像を読む順番に配置して、PDFとページ単位で対応させます。大幅に編集したい場合はこちらが適しています。
どのWord形式で出力されますか?
Microsoft Word、Google Docs、LibreOffice、そして最近のあらゆるエディターで開ける標準の.docxファイルです。
ページ数やファイルの上限はありますか?
決まった上限はありません。OCRは読み取りをお使いの端末で行うため1ページに数秒かかり、非常に長いスキャンはそのぶん時間がかかるだけです。進行状況の表示で、今どこまで進んでいるか正確に分かります。
ご注意: PDFは独自のフォントを埋め込んでいて、Wordはそれを使えないため、フォントは近いものに置き換えられます。そのため「見た目を再現」はピクセル単位で同一ではなく、ほぼ同一であり、行が元より少し広くなったり狭くなったりすることがあります。テキストのPDFの表は、Wordの表ではなく位置を指定したテキストとして変換されます。スキャンでは、罫線のある表はWordの表になりますが、罫線のない表は位置を指定したテキストのままです。OCRは、写真、ロゴ、装飾的なグラフィックが意味のない文字にならないようあえて無視し、手書きやスタンプは画像のまま残します。また1ページに数秒かかります。
このツールをあなたのサイトに設置
ブログ、授業のページ、ヘルプ記事などに無料で設置できます。コードを1つ貼り付けるだけで、訪問者がそのページ上でツールを使えるようになります。