将PDF转换为HTML
把PDF变成一个外观与原文件一致、无需任何附带文件的HTML——不需要样式表,不需要字体,也不需要图片文件夹。
- 绝不存储
- 无需排队,无需等待
- 无需注册,无水印
使用方法
添加PDF
拖放您想转成网页的文档。
转换
每一页都会重建为一个定位好的区块,包含页面图形和文字。
下载
得到一个.html文件,可直接打开、托管或通过邮件发送。
一个文件,零依赖,固定版式
输出结果就是一个.html文件,旁边没有任何附带文件。每张图片都以data URI形式内嵌,样式表写在head中,也不会从任何地方加载字体——所以即使在没有网络的电脑上,页面打开效果也完全一样,而这才是唯一值得拥有的HTML导出方式。代价是一道算术题:把二进制图片数据编码成文本,体积会增大约三分之一,所以一个10 MB的扫描版PDF会变成约14 MB的HTML,而浏览器必须全部解析完才能显示内容。
版式是固定的,而不是响应式的,这是有意的选择,而非疏漏。每一页都是一个与PDF尺寸(以点为单位)完全相同的盒子,每一行文字都是一个绝对定位在原始坐标上的span,字号和颜色也一并保留。任何内容都不会重排——在手机上您看到的是整页缩小,而不是一栏易读的文字。文件内含打印样式表,因此打印HTML时会在原来的页面边界处干净地分页。
由于文件不附带字体,文字会使用读者电脑上的Helvetica或Arial显示。字号和位置是对的,字形却不同,所以某一行文字可能会比背后的图形略宽。有一个巧妙的处理值得了解:当页面上的文字属于绘制的图形而非真实文本时,文字层依然会写出来,但设为透明——这样页面仍可选中、可搜索,文字又不会重复显示两次。
PDF中的链接会变成纯文本而不是锚点,标题会变成定位的span而不是标题元素,也谈不上什么阅读顺序。输出结果是对文档的精确再现,只不过恰好是用HTML做成的——它不是有结构、有语义的标记,不适合用在需要屏幕阅读器或搜索引擎理解内容的场合。
如果您需要的是别的
pdf2htmlEX才是把这件事做到位的工具。它会提取PDF自带的字体并作为网页字体嵌入,所以文字不仅位置正确,字体和宽度也都对;它还会把矢量图形重建为矢量,而不是把整页压平成一张图片。输出结果的还原度高得多,复杂程度也高得多。Poppler的pdftohtml -s -c in.pdf out.html则是快速的折中方案。
如果您真正想要的是一个网页,而不是一张网页形式的页面图——能在手机上重排、能被Google读懂、能让屏幕阅读器导航——那么任何PDF转HTML工具都给不了您,因为所需的结构在生成PDF时就已经丢掉了。请以流式模式转换为Word再从Word导出,或者回到生成这个PDF的原始文件。
常见问题
真的只有一个文件吗?
是的。所有图片都以data URI形式内嵌,样式也写在文件内部,因此没有需要一起保管的资源文件夹,断网时打开效果也完全一样。
文字可以选中吗?
可以。文字以真实的HTML文本形式叠放在页面图形上,可以选中、搜索,也能被屏幕阅读器朗读。
在手机上会自动重排吗?
不会,这是实打实的取舍:每一页都保持精确的版式,结果看起来像PDF,而不是响应式网站。如果需要可重排的文字,请使用“PDF转Word”或“PDF转文本”。
我的PDF会被存储吗?
不会。整个过程中不存储任何文件。
可以打印吗?
可以——文件内含打印样式表,每一页都会单独打印在一张纸上,也不会带上屏幕显示时的阴影。
小贴士: 版式是固定的,而不是响应式的:页面保持精确尺寸,在小屏幕上不会重排。页面图形以位图形式嵌入,因此非常大的文档会生成很大的HTML文件。PDF中的链接会变为纯文本。
把这个工具放到您的网站上
博客、课程页面或帮助文章均可免费使用。粘贴一段代码,访客就能直接在您的页面上使用。