跳到正文

翻译文档,格式不丢

把Word文档、Excel工作簿或PDF翻译成另一种语言,拿回的还是同一个文件——每个表格、图表、公式和图片都在原处。不存储任何文件,永远如此。

3个工具,无需注册,无水印

Word文档翻译把Word文档译成另一种语言,标题、表格、页眉页脚、脚注和图片原封不动;Excel翻译对工作簿做同样的事,并且不动任何公式所依赖的文本,让数字照样算得对;PDF翻译把每段译文放回同一页面、同样的图片之上。这三个工具都能识别文件所用的语言,支持50多种语言互译,而且从不把文档发送到任何地方。下面的说明解释“保留格式”到底需要做些什么,以及机器翻译在哪些地方需要人来把关。

翻译文档

3个工具

把Word文档和Excel工作簿译成其他语言,每种字体、每个表格和公式都留在原处。

为什么把文档粘贴进翻译器会把它弄坏

Word里的一个段落不是一串文字。它是一排文本块(run)——共享同一字体、字号和颜色的连续文字——中间夹着域、书签、批注锚点、脚注引用和图片。把文字复制出来、翻译、再粘回去,所有不是文字的东西都没了:加粗、链接、页码域、脚注标记。

显而易见的办法是逐个文本块翻译,结果更糟。不同语言的词序不同,所以“the red house”要变成“la casa roja”——形容词移了位置,加粗也得跟着移。把各段分开翻译,就会得到“la roja casa”,没有哪个说西班牙语的人会这样写。每个段落都必须整段翻译,让格式随文字一起走,然后再逐个文本块放回去。这些工具正是这样做的,所以加粗的词、超链接或高亮的短语会落在译文中对应的词上。

文件里的其他一切——样式、编号、页面设置、主题、图片——完全不会被改写。您下载的文件就是您的原文件,只是文字换了,而不是一份仿照原样重新搭建的新文档。

电子表格是程序,不只是文字

工作簿有一个文档没有的问题:其中有些文字是公式要拿来比对的数据。=COUNTIF(C:C, "Paid")统计的是包含英文单词“Paid”的单元格。把这些单元格译成“Pagado”,公式照样运行,照样显示一个数字,而这个数字现在是零。下拉列表、以产品名为键的查找、按名称引用的表格列,都会以同样悄无声息的方式失效。

所以Excel翻译会先读取工作簿里的每个公式、数据验证列表、数据透视表和表格引用,它们所依赖的任何文本都保持原样。页面会告诉您有多少个这样的单元格,不会在您不知情的情况下保留任何内容。工作表名称也不翻译,因为其他工作表和其他工作簿中的公式是按名称找到工作表的。

会被翻译的是人要阅读的一切:单元格文字、混合格式的富文本单元格、批注和注释、形状和文本框,以及图表标题和标签。数字、日期、代码和地址不动;在成千上万个单元格里重复出现的文字只翻译一次,所以处处译法一致。

机器翻译到底有多好,实话实说

这里用的翻译引擎是Mozilla为Firefox网页翻译打造的:流畅、快速,在英语与使用广泛的欧洲语言之间效果最好。它非常适合理解一份文档、起草一个待审阅的版本,以及翻译那些没人愿意花钱请译员的日常材料——信函、手册、价目表、报告。

在措辞举足轻重的场合,它无法替代专业译员。机器翻译可能译出一句读起来完美、意思却有微妙偏差的话,而且它无从知道您公司的术语。凡是法律、医疗、财务或要付印的内容,请让精通该语言的人检查。脱离上下文的短文本——比如一列叫“Net”或“Draw”的表头——对任何译者都是最难的情况,所以请快速看一下标题。

没有直接翻译模型的语言会经由英语中转。这是自动完成的,通常效果不错,但细微含义可能被损失两次,所以与英语之间的直接互译最为准确。

语言数据,以及为什么第一次运行比较慢

第一次翻译成某种语言时,需要下载它的语言数据——根据语言不同,大约15到70 MB,开始前页面会告诉您确切大小。下载后会保留下来,所以下一份同语言的文档一两秒就能开始,您也可以随时在工具页面上删除它。

这也正是您的文档无需去任何地方的原因。翻译就在这里、在您拖入的文件上进行,唯一需要传输的是对所有人都一样的语言数据。

这些工具的技术基础

真正完成处理工作的开源引擎,以及它们所实现的技术规范。

  • Bergamot TranslatorMPL-2.0 — 负责翻译——Mozilla的引擎,也就是Firefox内置的那个.
  • Firefox Translations modelsMPL-2.0 — 是语言模型,由Mozilla训练,在本站原样提供.
  • fflateMIT — 打开并重写每个.docx和.xlsx文件本质上所是的ZIP包.
  • HarfBuzzMIT — 在翻译后的PDF中为孟加拉文、印地文、阿拉伯文等复杂文字进行字形塑形,并把字体精简到只含用到的字符.
  • Bijoy2UnicodeMIT — 把旧PDF中的传统Bijoy(SutonnyMJ)孟加拉文文本转换为Unicode,以便翻译.
  • BharatType Hindi Text UtilitiesMIT — 把旧PDF中的传统Kruti Dev印地文文本转换为Unicode,以便翻译.
  • Noto Sans CJKOFL-1.1 — 为翻译成中文、日文和韩文的PDF排版.
  • ECMA-376 (Office Open XML)Specification — 是Word和Excel文件背后的标准,规定了哪些部分是文本.

常见问题

真的免费吗?

是的——无需注册,没有页数限制,无水印。每次翻译都不收费,因为翻译根本不在我们的服务器上进行。

我的文档会被存储或上传吗?

不会。文档在这里完成翻译,从不发送到任何地方,也不存储任何文件。唯一需要下载的是语言数据,对所有人都一样。

支持哪些语言?

50多种,包括西班牙语、法语、德语、葡萄牙语、意大利语、荷兰语、波兰语、俄语、乌克兰语、土耳其语、阿拉伯语、波斯语、希伯来语、印地语、孟加拉语、乌尔都语、泰米尔语、中文、日语、韩语、印尼语、泰语和越南语。其中任意一种都能译成其他任意一种。

PDF应该直接翻译,还是先转成Word?

如果是为了阅读或分享,请用[PDF翻译](translate-pdf):页面会完全保持原样。如果还要继续编辑译文,请先用[PDF转Word](pdf-to-word)转换,再用[Word文档翻译](translate-docx)——Word文档能随较长的文字重新排版,而PDF页面做不到。

旧的.doc和.xls文件怎么办?

用Word或Excel打开,另存为.docx或.xlsx,或者用[XLS转XLSX](xls-to-xlsx)转换电子表格,然后翻译新文件。