PDF 转 Word
PDF 里没有段落。它里面只有一个个字符,各自记着自己画在页面的哪个位置——段落、标题和阅读顺序在生成这个文件的那一刻就被丢掉了。这个页面把那些位置读回来,再把结构猜出来:共用同一条基线的字符并成一行,行距够近的几行并成一段,字号明显比正文大的当成标题。普通的单栏文档做得不错,排成格子的东西就做不好。每次跑完它会告诉你你这份是哪一种。
- 不上传
- 不用注册
- 无水印
- 不限文件数
你的文件
普通单栏文档做得最好。表格、多栏版面和用图画出来的东西没办法原样保住——跑完底下那几行会说你这份的情况。
只有完全没有文字的页面才会送去 OCR。第一次用会下载识别引擎(约 15 MB),一页要好几秒,出来的是纯文本,没有标题也没有加粗。
默认不保留,所以跨两页的段落会被接回去。需要 Word 文件跟 PDF 一样分页时再打开。
还没选文件。
你的文件去了哪里
哪里都没去。这个网页会下载一小段程序到你的浏览器,由它直接读取你硬盘上的文件。程序本身来自本站,就像图片或样式表一样——但你的文件只会从硬盘走到你自己的浏览器标签页里。
为什么用这个
那些大型转档站给不了你的东西。
还原出来的是段落,不是一行一段
常见的免费转换工具是印出来的一行给你一个 Word 段落,于是每句话都在 PDF 恰好换行的地方被切断,你什么都重排不了。这里会把行接回去——包括行尾用连字符断开的单词——只有在行距、缩进、字号或粗细真的变了的地方才起新的一段。
标题是真的 Word 标题
比正文大的字号会按大小排名,对应到「标题 1」「标题 2」「标题 3」,所以导航窗格会列出大纲,「引用 → 目录」也抓得到。加粗和斜体取自那一段字符当初用的字体,不是看字形去猜。
重复的页眉页脚和页码会去掉
同一句话出现在四十页的页首,那不是四十段内容。落在上下边距、又在半数以上页面重复出现的行,以及单独的页码,会被移除——移除了几行会报给你,你才判断得出它有没有拿掉不该拿的东西。
做不到的地方它会讲
多栏版面、看着像表格行的行、裁不出来的图片、侧着印的文字、整页没有文字的扫描页,每一项都会算数量、写清楚原因,就放在下载按钮底下。要不要把这份文件发出去,你看完再决定。
怎么用
选一个或多个 PDF。里面有扫描件的话,先把 OCR 那个勾打上。
按开始。每一页要读两遍——一遍读文字,一遍算版面——所以长文档会跑一阵子。
下载 .docx,然后把按钮底下那几行说明看完,那里写着哪些东西没转过去。
什么时候会用到
只想改别人那份 PDF 里的两段话
要沿用供应商的条款、合同里的某一条、报告里的某一节。你要的是能改的字,不是一张页面的图。
不想整篇重打一遍
方案、文章或手册只剩 PDF 一种格式,而正文得挪到一个你动得了的地方。
这个文件不能传给不认识的服务器
合同、诊断书、工资单,还有签了保密协议的东西。别的转换网站一律要先把文件传上去才肯动。
常见问题
转出来会跟 PDF 长得一样吗?
不会,也没往那个方向做。这不是一个复制版面的工具。它把文字按阅读顺序放回去、套 Word 自己的样式,纸张大小跟原文件一样,页边距取自文字实际落在哪里。换行位置、原本的字体、字间距、分栏,还有用矢量画出来的东西,都不会重现。要一模一样的外观,你需要的就是那份 PDF。
表格会怎么样?
不会变成 Word 表格。PDF 里根本没有「表格」这回事,只有一格格恰好对齐的文字。当一行中间有很宽的空隙时,那些空隙会变成制表符(Tab),这一行自己成一段,所以数据一个不少、顺序也对。想要真的表格,在 Word 里把那几行选起来,用「插入 → 表格 → 文本转换成表格」,分隔符选「制表符」。报告里会写有几行是这么出来的。
双栏的页面呢?
做法是找一条从上到下没有任何一行跨过去的空白竖带,找到就把每一栏各自从上往下读完再读下一栏——那正是正确的阅读顺序,而且会报给你让你自己核对。三栏也是同样做法。会坏掉的是栏位在页面中途才开始或结束、或者侧栏压到正文的版面,那种会交错在一起,你一眼就看得出来。
我的 PDF 是扫描的,转出来是空的。
扫描页就是一张纸的照片。里面没有字符可以读,也就没有东西可以转。把「用 OCR 读扫描页」勾上,那些页会改用识别的方式处理——但这里的 OCR 只有英文,一页要好几秒,而且回来的是纯文本,没有标题也没有加粗。如果你的扫描件不是英文,这个工具帮不了你,调什么设置都一样。
加粗和斜体准吗?
它取自那一段字符当初用的字体,所以只要原文件用的是真正的粗体或斜体字型就会是对的,而这是大多数情况。不准的情况是:PDF 用「把轮廓描两遍」伪造加粗,或者把一个正体字斜着画而我们没认出来。下划线、文字颜色和荧光标记则完全不会带过去。
可以一次转很多个文件吗?
可以,一个 PDF 出一个 .docx。超过三个会打包成一个 zip,因为浏览器会拦掉连续触发的下载,不打包的话你会莫名少掉几个文件。超过 2 GB 的 PDF 根本打不开——浏览器没办法一次读进那么大的文件,那是浏览器的限制,不是我们定的规矩。
我的文件会被上传吗?
不会。PDF 是这个页面直接从你的磁盘读的,Word 文件在这个标签页里组出来,下载也是从你自己的浏览器出去的。你可以一边开着网络面板一边看它跑。PDF 解析器和 OCR 引擎第一次用的时候会从本站下载,跟任何一段脚本一样——你的文档不在里面。
其他工具
压缩图片
把照片变小,而且不用上传
压缩 PDF
把 PDF 变小,而且不用上传
压缩视频
把视频文件变小
裁剪视频
在画面上拉一个框,只留框里那块
视频转 GIF
把视频的一小段变成会动的 GIF
合并 PDF
把多个 PDF 并成一个
拆分 PDF
把某几页单独取出来
PDF 转 JPG
把 PDF 的每一页变成一张图片
音频剪辑
剪出音频文件的一段
视频剪辑
剪一段视频,不重新编码
裁剪图片
在图上拉一个框,歪了就先转正
拼接图片
把几张图拼成一张
HEIC 转 JPG
iPhone 照片转成 JPG
JPG 转 PDF
把 JPG 和 PNG 合成一个 PDF
视频转 MP3
把视频里的声音抽出来
Word 转 PDF
把 .docx 转成 PDF,或一页一个文件
Markdown 转 Word
把 .md 变成 .docx
Markdown 转 PowerPoint
把 Markdown 大纲变成幻灯片
图片转文字
把图片里的文字读出来
拆分 Excel 工作表
一张表一个文件
拆分 Excel 每一行
一行一个文件