文書が持っているもの、そして各変換がそれをどう扱うか
.docxはXMLファイルをまとめたZIPで、文書を文書たらしめているものの大半はテキストではありません。まずスタイルがあります。「見出し 1」のように名前の付いた定義で、多くの段落が共有します。そして直接書式があります。誰かが行を選択して太字ボタンを押したものです。見た目は同じでも、変換での振る舞いはまったく違います。スタイルはスタイルとして残り、直接書式を付けた部分は、それが生み出した書式としてしか残りません。さらに、段落番号の定義、変更履歴、コメント、脚注、ヘッダーとフッター、テキストボックス、埋め込みフォント、文書のプロパティがあり、それぞれ段落のテキストとは別に保存されています。
リストの番号がいちばん分かりやすい例です。 Wordは「1.」をテキストとして保存していません。段落番号の定義への参照を保存し、ページを描画するときに番号を計算しています。そのため、段落のXMLをたどるだけのテキスト抽出ツールは番号をすべて落とし、番号のないリストを返してきます。DOCX TXT変換はそうせず、「1.」「1.1」「a)」「iii.」といった番号を、文書の途中で振り直されたり続きから始まったりするリストも含めて再構築します。
変更履歴とコメントは、偶然ではなく判断の問題です。 レビュー中の文書には、削除されたテキストと挿入されたテキストの両方が、印を付けた状態で同じファイルに入っています。DOCX TXT変換は、すべての変更を承諾したものとして読み取ります。挿入は残し、削除は含めません。コメントは一切含めません。プレーンテキストを公開の場に出すなら、たいていはこれが望ましい動作です。脚注と文末脚注は[1]のような記号で示し、注の本文は末尾にまとめます。ヘッダーとフッターはオンにして含めることもできます。テキストボックスは、重複したり消えたりせず、読む順番どおりに1回ずつ現れます。
PDFへの変換で固定されるのは、ページ区切りです。 ワープロソフトでは、4ページ目がどこで終わるかはファイルを開くたびに、開いた人のフォントとプリンタードライバーを使って計算し直されます。自分の画面では問題ないのに、受け取った相手のところでは表が2ページに分かれてしまうのはこのためです。PDFにはこの再計算がありません。改ページは変換時に一度だけ決まり、以後はファイルの確定した事実になります。Word PDF変換、ODT PDF変換、RTF PDF変換は、ブラウザによる近似ではなく、本物のワープロソフトによる完全なレイアウトから改ページを決めます。テキストボックス、図形、ヘッダー、フッターが作成者の置いた位置に収まるのはそのためです。
失われるのは、編集のしやすさとリフローです。 スタイルは見た目の書式になり、アウトラインはしおりになり、テキストはスマートフォンの画面に合わせて折り返されなくなります。文書に埋め込まれたフォントはそのまま使われます。埋め込まれておらず、変換側でも使えないフォントは、文字幅が互換の最も近いフォントに置き換えられるため、字形は変わっても行の折り返し位置は変わりません。
電子書籍には、保つべきページがありません。 EPUB、MOBI、AZW3はリフロー型です。どこでページが終わるかは、選んだフォントサイズに応じて閲覧アプリが決めます。つまり「40ページ目」は本の属性ではなく、PDFのページ区切りは、変換時に選んだページサイズと余白から新たに作られます。ファイルに入っているのは章の構成と目次で、これらはPDFの本物のリンクとしおりになります。AZW3にはスタイルシートがあり、フォントが埋め込まれていることも多いので、出版社がデザインしたとおりの見た目になります。古いMOBIファイルにはスタイルシートがまったくありません。変換したMOBIがKindleアプリで見る同じ本より簡素に見えるのはこのためで、アプリのほうが、ファイルにはもともとない組版を付け加えていたのです。
RTFは中身まで完全にテキストです。 何十年もソフトウェアの世代交代を生き延びてきたのはそのためです。落とし穴は文字コードです。RTFはUnicodeより古く、テキストを中欧、キリル、ギリシャ、日本語などの古いコードページで保存しているため、うまく変換されなかったRTFでは文字化けが起きます。ここでは、それぞれのコードページを、最新のUnicodeテキストとあわせて正しくデコードします。
ブラウザが本当に適さない場面
これらのツールには、ファイルを完全に手元にとどめるものと、サーバーに渡すものがあり、どちらなのかは正確にお伝えしておく価値があります。PDFテキスト抽出、TXT PDF変換、DOCX TXT変換、HTML DOCX変換、Markdown HTML変換は、何も送信しません。 ファイルはこの場で読み込まれ、変換され、書き出され、外部には何も出ていきません。Word PDF変換、ODT PDF変換、RTF PDF変換、HTML PDF変換、Markdown PDF変換と3つの電子書籍変換ツールは、Toolifineのサーバーで変換を行います。 ワープロソフトのページレイアウトを再現したり、本のページを正しく組んだりすることは、Webページではごまかしがきかないからです。送信される内容は異なります。Word、ODT、RTFの文書はそのまま送られますが、Markdownファイルと電子書籍はまず展開されて1つのWebページに組み立てられ、送られるのはその組み立てたページです。いずれの場合も暗号化された接続で送信され、変換され、ダウンロードの準備ができた時点で削除されます。保存も、記録も、共有もされません。また、どのツールもサーバーに接続できない場合は独自の変換機能に切り替わり、切り替えたことと、その代替機能では保てなかった点をお知らせします。
開けない形式。 Word 97〜2003の旧バイナリ形式の.docファイルは、サーバーが直接読み込むのでWord PDF変換では問題なく変換できますが、ブラウザ側で動くDOCX TXT変換では読み込めず、.docxが必要です。パスワードで保護された文書は、パスワードを設定したソフトでパスワードを外してください。DRMで保護されたKindle本は、どこのどんな変換ツールでも開けません。それが保護の目的だからです。Kindleアプリしか読めないAmazonの新しいKFX形式も同様です。
長い文書の作業。 マスター文書、相互参照フィールド、索引、自動生成される引用一覧、差し込み印刷、文献管理ツールはワープロソフトの機能であり、変換ツールはワープロソフトではありません。LibreOfficeをインストールしてください。無料で、このページのすべての形式を読み込めます。こうした作業には、まさにうってつけのソフトです。
一括処理と自動化。 これらのツールは、人がクリックしたときに動きます。1,000件のファイルを定期的に変換するのはコマンドラインの仕事で、無料のツールが優秀です。ヘッドレスモードのLibreOfficeはWriterで開けるものなら何でも変換でき、PandocはMarkdown、HTML、DOCX、LaTeXなど十数種類の形式の間を、どんなWebフォームより細かく制御しながら変換できます。Calibreは電子書籍をまとめて処理し、保護されていないあらゆる電子書籍形式の間で変換できます。
逆方向での忠実なレイアウト再現。 凝ったデザインのPDFを編集可能な文書に戻すのは、変換ではなく推測の問題で、完璧にこなせるものはありません。Toolifineも、高価なデスクトップ製品も同じです。元の文書が残っているなら、そちらを編集してください。
似た名前のツールの選び方
Markdown PDF変換とMarkdown HTML変換。解析エンジンは同じで、出力先が違います。Markdown PDF変換は、書体、ページサイズ、余白を選べるページ区切り付きの文書を作り、見出しはPDFのしおりに、目次は該当ページへ移動できるリンクになります。印刷、添付、保管向けです。Markdown HTML変換は、スタイル付きの単体ページか、CMSに貼り付けるための素のスニペットを作ります。公開向けです。MarkdownをWordで使いたいなら、Markdown HTML変換を経由してからHTML DOCX変換を使ってください。
Word PDF変換とODT PDF変換とRTF PDF変換。中身は同じ変換で、違うのは入力するファイルだけです。.docxにはWord PDF変換。LibreOffice、OpenOffice、Google Docsで「OpenDocument形式でダウンロード」したものにはODT PDF変換。WordPad、TextEdit、そして業務システムが今も出力している通知書やレポートにはRTF PDF変換です。拡張子に合ったページを選ぶことは、思うほど重要ではありません。大事なのは、どれもTXT PDF変換ではないという点です。TXT PDF変換には、そもそも保つべき書式がありません。
TXT PDF変換とMarkdown PDF変換。TXT PDF変換は、テキストをテキストのまま組みます。書体は1つ、余白は指定どおり、解釈は一切しません。Markdown PDF変換は#や*を指示として読み取り、見出し、リスト、表、ハイライトされたコード、しおりのアウトラインを作ります。MarkdownファイルをTXT PDF変換に入れると、アスタリスクがそのまま並んだPDFになります。
EPUB・MOBI・AZW3のPDF変換。 3つとも名前が示す以上の形式を受け付けるので、どれを使ってもファイルは開けます。ページの見た目が違うのは、本そのものが違うからです。EPUBとAZW3(KF8)はスタイルシートを持ち、フォントが埋め込まれていることも多いため、デザインされた見た目になります。MOBIは書式が最小限の古い形式で、変換したPDFはあえて簡素にしています。Kindleファイルに両方のレイアウトが入っている場合は、新しいほうを使います。
HTML DOCX変換とMarkdown HTML変換。HTML DOCX変換はまずマークアップをレイアウトするので、適用後のCSS(フォント、サイズ、色、間隔、罫線)が本物のWordの書式として文書に書き込まれます。見出しはWordの見出しスタイルに、リストや表も位置を固定したボックスではなく本物のリストや表になります。Markdown HTML変換は、そのマークアップをそもそも作るためのツールです。どちらもJavaScriptは一切実行しません。
DOCX TXT変換とPDFテキスト抽出。どちらもプレーンテキストを出力しますが、読み取っているものはまったく違います。.docxは段落、リスト、表が何なのかを今も把握しているため、DOCX TXT変換はリストの番号を再構築し、表の行をまとめたまま保てます。PDFが知っているのは各文字が描かれた位置だけなので、PDFテキスト抽出は位置から行や段落を推測します。精度は高いものの、構造の忠実さでは及びません。元の文書とそのPDFの両方があるなら、元の文書から抽出してください。
DOCX TXT変換とWordの「.txtで保存」の違い。 Word自身のテキスト書き出しは、リストの番号を落とし、表を崩し、文字コードも独自の判断で決めてしまいます。DOCX TXT変換は番号を再構築し、表はスプレッドシートにそのまま貼り付けられるタブ区切りの行か、中国語や日本語でも揃ったままの整列した列として書き出し、指定した改行コードのUTF-8で保存します。