跳到正文

将DOCX转换为TXT

把Word文档里的文字提取出来——列表编号、表格和脚注完整保留,内容不重复——可直接复制或保存为.txt文件。绝不存储任何文件。

  • 绝不存储
  • 无需排队,无需等待
  • 无需注册,无水印

使用方法

1

添加文档

把.docx文件拖放到页面上。文字会立即显示出来。

2

选择保留哪些内容

表格以Tab分隔的行或列对齐的形式输出,可选页眉和页脚、脚注,以及Windows或Mac/Linux换行符。

3

复制或下载

如有需要可以先编辑文字,然后复制,或保存为UTF-8编码的.txt文件。

保留文字,舍弃其余一切

.docx是一个装着XML的ZIP压缩包,文字就在其中的一个文档部件里。因此提取文字是可靠的,这一点从PDF中提取文字做不到——文字以文字的形式、按阅读顺序存储,不需要根据字形位置重建,也不存在哪一栏在前的歧义。无论这种转换丢失了什么,都不会丢失文字,也不会打乱文字顺序。

纯文本按定义就容纳不了其他一切:粗体和斜体、字体和字号、颜色、页面版式、页眉和页脚。凡是纯文本有对应惯例的结构都会保留——段落保持分开,列表项保留标记和缩进,表格单元格之间有分隔,让各行仍然可读,而不是挤成一整行。脚注会被集中列出而不是丢弃,因为脚注的内容也是文字。

图片、图表和SmartArt会被略去——它们没有可提取的文字,放个占位符对谁都没用。公式以简单的线性形式输出,如a/b + x^2,而不是符号,这是诚实的折中:可读、无歧义,也不假装是排版。

两点实用说明。修订和批注不包含在内——您得到的是文档当前的样子,而不是它的修订历史,如果您本想找回某段被删除的内容,这一点值得了解。另外,旧版.doc文件需要先另存为.docx,因为1997年的二进制格式是完全不同的东西,只是用途相同而已。

如果您需要的是别的

Pandoc能把.docx转成文本或Markdown,而且控制得更精细:纯文本用pandoc in.docx -t plain -o out.txt,或者用-t markdown把标题、强调和列表保留为可读的标记——当人们说“只要文字”时,真正想要的通常就是这个。它还能把图片提取到文件夹中,而不是丢弃。

如果要从成百上千份文档中提取文字,Python的python-docx和docx2txt能以编程方式给出段落,方便您筛选、搜索或建立索引,而不是逐个文件去读。至于专门查看修订或批注,无论转换器还是脚本都比不上直接打开文档——这些信息就在文件里,只是不属于“文字”而已。

常见问题

我的文档会被存储吗?

不会。文档绝不会被存储,也不会被发送到任何地方——对于合同、简历以及其他任何您不愿粘贴到网站上的内容,这一点很重要。

列表编号会保留吗?

会,与Word中显示的完全一致:“1.”、“1.1”、“a)”、“iii.”以及项目符号,包括在文档中重新编号或接续编号的列表。大多数文本提取工具会把编号完全丢掉,因为Word并不把它们存储为文本。

表格怎样转换?

由您选择。Tab分隔的行可以直接粘贴到Excel或Google Sheets中;列对齐作为纯文本阅读效果好,即使有中文或日文字符,列宽也保持正确。

修订和批注怎么处理?

文字按接受所有修订后的样子输出:删除的内容略去,插入的内容保留。批注不包含在内。

会包含文本框、脚注、页眉和页脚吗?

文本框始终包含在内,每个只出现一次,按阅读顺序排列。脚注和尾注以[1]这样的标记出现,注释内容列在末尾;页眉和页脚可以选择开启。

.txt文件是什么编码?

UTF-8,所有现代编辑器都能正确打开,并且能容纳所有语言。如果文件要交给老旧的Windows程序使用,请选择Windows换行符。

小贴士: 旧版.doc文件需要先另存为.docx,受密码保护的文档需要先移除密码。图片、图表和SmartArt会被略去;公式以a/b + x^2这样的简单线性形式输出。

把这个工具放到您的网站上

博客、课程页面或帮助文章均可免费使用。粘贴一段代码,访客就能直接在您的页面上使用。