工具介绍
此工具会读取PDF每一页的文本内容,并在Excel工作簿中将其重建为行和列,每一页对应一个工作表。它先根据垂直位置把文本归并成行,再在每行中遇到较大的水平间距处进行分列——这是判断“此处应为新列”的一种合理近似方法,而不仅仅是简单的空格分割。
这种启发式方法对结构简单、间距均匀的PDF表格或列表效果较好,例如发票、价目表、导出的报表。但对于含有合并单元格、跨行内容,或列与列之间没有明显间距的复杂表格,它无法可靠地还原原始结构——遇到这类情况,下载后通常需要手动调整结果。
为什么使用它?
- 将PDF中的表格和列表转换为可编辑、可排序的Excel文件,免去手动重新输入数据的麻烦。
- 无需注册,无水印,完全免费。
- 本地处理,隐私安全——你的PDF文件不会被上传到任何服务器。
- 每个PDF页面对应一个工作表,多页文档也能保持条理清晰。
使用方法
- 点击方框或将PDF文件拖拽到方框中。
- 等待工具提取文本并将其排列为行和列。
- 下载生成的.xlsx文件,用Excel、Google表格或其他表格软件打开。
- 检查分列结果——对于复杂表格,你可能需要手动调整部分单元格。
示例
输入
invoice.pdf — 一份包含明细表格的单页发票输出
invoice.xlsx — 一个工作表,每一行对应一条发票明细,列包括商品名称、数量和价格转换准确度很大程度上取决于原始PDF的排版方式——列间距清晰的简单表格转换效果良好,而密集或间距不规则的表格可能需要手动整理。
常见问题
为什么我的某些列被合并在一起或被错误拆分了?
此工具是根据PDF底层文本层中单词之间的水平间距来推测列边界的——它无法访问PDF的原始表格结构(大多数PDF本身并不保留这种结构)。如果列间距较小,或表格使用了不寻常的间距方式,推测结果就可能出错。请检查转换结果,如有需要请手动调整。
这个工具能处理扫描版PDF吗?
不能。此工具读取的是PDF中内嵌的文本层;扫描文档本质上是图片,没有可提取的文本。请先使用PDF OCR工具为其添加文本层,然后再使用本转换器。
我的PDF文件会被上传到服务器吗?
不会。文本提取和Excel文件生成都通过JavaScript在你的浏览器本地完成,文件绝不会离开你的设备。
转换后能保留原表格的单元格格式、颜色或合并单元格吗?
不能。输出结果是排列成网格的纯文本——原PDF中的字体、颜色、边框和合并单元格都不会被保留。