コンテンツへスキップ

書式を崩さずにドキュメントを翻訳

Word文書、Excelブック、PDFを別の言語に翻訳し、同じファイルとして受け取れます。表、グラフ、数式、画像はすべて元の位置のまま。何も保存されることはありません。

3個のツール・登録不要・透かしなし

Word翻訳はWord文書を、見出し、表、ヘッダー、脚注、画像に手を加えずに別の言語にして返します。Excel翻訳はブックに対して同じことを行い、数式が参照しているテキストには手を付けないので、数値の計算は合ったままです。PDF翻訳は、翻訳した段落を同じページの同じ画像の上に配置し直します。3つとも、ファイルが何語で書かれているかを判別し、50以上の言語の間で翻訳でき、文書をどこにも送りません。以下では、「書式を保つ」には実際に何が必要なのか、そして機械翻訳のどこに人の確認が必要なのかを説明します。

ドキュメント翻訳

3個のツール

Word文書やExcelブックを別の言語に。フォント、表、数式はすべて元の位置のまま。

文書を翻訳サービスに貼り付けると崩れる理由

Wordの段落は、ただの文字列ではありません。同じフォント、サイズ、色を共有するひとまとまりのランが並んだもので、その間にフィールド、ブックマーク、コメントの位置、脚注の参照番号、画像が挟まっています。テキストをコピーして翻訳し、貼り戻すと、文字以外のものはすべて消えてしまいます。太字も、リンクも、ページ番号のフィールドも、脚注の記号もです。

すぐに思いつく解決策、つまりランごとに翻訳する方法は、もっと悪い結果になります。言語によって語順が異なるため、英語の「the red house」はスペイン語では「la casa roja」になります。形容詞が移動し、太字も一緒に移動しなければなりません。部分ごとに別々に翻訳すると「la roja casa」になり、スペイン語を話す人なら決してそうは書きません。各段落は丸ごと翻訳し、書式を言葉と一緒に運ぶ必要があります。そのうえでランごとに戻します。これらのツールはそれを行っているので、太字の単語、ハイパーリンク、ハイライトされた語句が、翻訳後も正しい言葉の上に来ます。

ファイル内のそれ以外のもの(スタイル、段落番号、ページ設定、テーマ、画像)は一切書き換えません。ダウンロードするファイルは、元のファイルの言葉だけが変わったもので、元に似せて一から作った新しい文書ではありません。

スプレッドシートはテキストではなくプログラム

ブックには、文書にはない問題があります。一部の言葉が数式の比較対象となるデータなのです。=COUNTIF(C:C, "Paid")は、英語の「Paid」という語を含むセルを数えます。セルを「Pagado」に翻訳しても数式はそのまま動き、数値も表示されますが、その数値はゼロになります。ドロップダウンリスト、製品名をキーにした検索、名前で参照されるテーブルの列も、同じように気づかないまま機能しなくなります。

そこでExcel翻訳は、まずブック内のすべての数式、入力規則のリスト、ピボットテーブル、テーブル参照を読み取り、それらが依存するテキストは一切変えずに残します。それが何個のセルだったかはページに表示されるので、知らないうちに何かが翻訳されずに残ることはありません。シート名もそのまま残します。ほかのシートやほかのブックの数式は、シートを名前で探すからです。

翻訳されるのは、人が読むものすべてです。セルのテキスト、書式が混在するリッチテキストのセル、コメントやメモ、図形やテキストボックス、グラフのタイトルやラベルです。数値、日付、コード、アドレスには手を付けません。何千ものセルで繰り返されるテキストは1回だけ翻訳するので、どこでも同じ訳になります。

機械翻訳の実力を正直に

ここで使っている翻訳は、MozillaがFirefoxのページ翻訳のために作ったものです。自然で速く、英語と広く話されているヨーロッパの言語との間で最も力を発揮します。文書の内容を理解する、確認用の下訳を作る、翻訳者にお金を払ってまで訳すことのない日常的な資料(手紙、マニュアル、価格表、報告書)を翻訳する、といった用途には非常に優秀です。

言葉の選び方が重要な場面では、専門家の代わりにはなりません。機械翻訳は、完璧に読めるのに微妙に違うことを言っている文を作ることがあり、あなたの会社の用語を知る手段もありません。法律、医療、財務に関わるもの、印刷に回すものは、その言語に堪能な人に確認してもらってください。文脈のない短いテキスト(「Net」や「Draw」という名前の列など)は、どんな翻訳者にとっても最も難しいケースなので、見出しにはざっと目を通してください。

直接のモデルがない言語の組み合わせは、英語を経由して翻訳します。これは自動で行われ、たいていはうまくいきますが、ニュアンスが2回失われる可能性があるため、英語との直接の組み合わせが最も正確です。

言語データと、初回に時間がかかる理由

ある言語に初めて翻訳するときは、その言語データがダウンロードされます。言語によって約15〜70 MBで、始める前に正確なサイズがページに表示されます。その後は保持されるので、同じ言語の次の文書は1〜2秒で始まり、言語データはツールのページからいつでも削除できます。

文書をどこにも送る必要がないのも、そのためです。翻訳はここで、ドロップしたファイルに対して行われ、やり取りされるのは誰にとっても同じ言語データだけです。

これらのツールを支える技術

実際の処理を担うオープンソースのエンジンと、それらが実装している仕様です。

  • Bergamot TranslatorMPL-2.0 — 翻訳を実行。Firefoxに組み込まれているMozillaのエンジンです.
  • Firefox Translations modelsMPL-2.0 — Mozillaが学習させた言語モデルで、ここでは手を加えずに配信しています.
  • fflateMIT — .docxや.xlsxの実体であるZIPパッケージを開いて書き直し.
  • HarfBuzzMIT — 翻訳したPDFでベンガル語、ヒンディー語、アラビア語などの複雑な文字を組み、フォントを使用する文字だけに絞り込み.
  • Bijoy2UnicodeMIT — 古いPDFに含まれるレガシーなBijoy(SutonnyMJ)のベンガル語テキストを、翻訳できるようUnicodeに変換.
  • BharatType Hindi Text UtilitiesMIT — 古いPDFに含まれるレガシーなKruti Devのヒンディー語テキストを、翻訳できるようUnicodeに変換.
  • Noto Sans CJKOFL-1.1 — 翻訳したPDFの中国語・日本語・韓国語を組版.
  • ECMA-376 (Office Open XML)Specification — WordとExcelのファイルの基になる標準規格で、どの部分がテキストかを定めています.

よくある質問

本当に無料ですか?

はい。登録不要、ページ数の制限なし、透かしなしです。翻訳はどれも当サイトのサーバーで行われないので、翻訳ごとに料金がかかることもありません。

文書は保存されたりアップロードされたりしますか?

いいえ。文書はここで翻訳され、どこにも送られず、何も保存されません。ダウンロードされるのは言語データだけで、これは誰にとっても同じものです。

対応している言語は?

50以上です。スペイン語、フランス語、ドイツ語、ポルトガル語、イタリア語、オランダ語、ポーランド語、ロシア語、ウクライナ語、トルコ語、アラビア語、ペルシャ語、ヘブライ語、ヒンディー語、ベンガル語、ウルドゥー語、タミル語、中国語、日本語、韓国語、インドネシア語、タイ語、ベトナム語などに対応しています。どの言語からどの言語にも翻訳できます。

PDFは直接翻訳すべきですか、それとも先にWordに変換すべきですか?

読んだり共有したりするだけなら、[PDF翻訳](translate-pdf)を使ってください。ページはそのままの状態で保たれます。翻訳後も編集を続けたいなら、[PDF Word変換](pdf-to-word)で変換してから[Word翻訳](translate-docx)を使ってください。Word文書は長くなったテキストに合わせてレイアウトが流し直されますが、PDFのページにはそれができません。

古い.docや.xlsファイルはどうすればいいですか?

WordやExcelで開いて.docxや.xlsxとして保存するか、スプレッドシートなら[XLS XLSX変換](xls-to-xlsx)で変換してから、新しいファイルを翻訳してください。