把PDF里的表格搬进Excel,难点从来不是打开文件,而是打开之后能不能直接求和。市面上不少在线转换器给出的所谓Excel文件,实质是把每一个单元格都当成文本写进去:1,240在屏幕上长得像数字,选中一整列却算不出合计,只能一格一格重新敲。DocPivot的PDF转Excel在浏览器内完成解析,输出标准的Excel工作簿(.xlsx),数字以数值单元格写入,扫描件可以免费用OCR读取,不限页数、不限文件体积;除非你主动开启OCR,文件不会离开你的设备。
它真正解决的是哪个问题
核心问题出在CSV这种格式本身。表格里一个写着1,240的单元格,导出成CSV时必须加引号包起来,否则那个千位逗号会把一个字段劈成两个。加了引号之后,Excel打开它就按文本处理,SUM函数返回0,右上角挂一个绿色小三角提示“数字以文本形式存储”。财务和运营人员每天都在跟这个绿三角打交道,解决办法通常是分列、选择性粘贴、乘以1,一套操作下来比手工重录快不了多少。
写入真正的工作簿就绕开了这一层。.xlsx的本质是一个ZIP包,里面装着描述每个工作表的XML,单元格在XML里有明确的类型标记:数值就是数值,字符串就是字符串。这个差别在实测中可以直接验证——用LibreOffice打开生成的工作簿,1240以数字形式返回,工作表XML里B3记为NUM 1240,同一行的A3记为TXT North。类型是写在文件结构里的,不依赖打开它的软件去猜。
如果你的目标只是把PDF内容取出来编辑,而不是做计算,那么PDF转Word工具或者更轻量的PDF转文本工具可能更合适。表格转Excel要处理的是另一类需求:结果必须能参与运算。
工作原理:从坐标到网格,再到工作簿
整个流程分四步,全部在浏览器里跑完。
第一步,读取页面。内置的pdf.js 6.2.108返回页面上每一段文本及其坐标。PDF文件格式里其实没有“表格”这个概念,只有一堆带位置信息的文字片段,所谓表格是人眼在版面上看出来的结构。这一步不上传任何内容。
第二步,重建网格。文本片段按基线聚类成行,按x坐标聚类成列,于是版面上的表格重新变回一张网格。这套方式不依赖表格框线,所以那些没有画线、只靠对齐排版的财务报表和对账单同样能被识别出来——这类PDF恰恰是纯框线检测方案最容易失手的地方。
第三步,按需只保留表格。页面的标题、正文段落、脚注在网格里会变成只有一格的行。默认全部保留;切到“仅表格”模式后,这些单格行被丢掉,真正的表头就落在第1行,拿到手就能直接透视或做数据源。
第四步,写出工作簿。工作表以XML形式打包进ZIP,用引擎里已有的ZIP写入模块生成,整个工作簿写入器大约200行代码,没有引入任何电子表格库。数字写成数值单元格,其余内容写成内联字符串。最后交付一个Excel工作簿——每页一个工作表,或者全部合并为一个工作表,也可以直接要CSV。
核心优势
- 数字就是数字:输出的是可求和、可做透视表的数值单元格,不是一堆需要二次清洗的文本。
- 扫描件免费识别:OCR不设付费墙,而同类产品普遍把扫描件识别放进会员权益里。DocPivot把它作为默认可用的选项,只是在按钮上方明确标注这一步需要上传。
- 不限页数与体积:解析在本地完成,没有服务器成本,也就没必要设10页或50MB这样的门槛。三百页的年报和两页的对账单走同一条路径。
- 本地处理:除OCR外的全部流程在浏览器内存中完成,文件不上传、不留存。合同、工资表、客户名单这类材料不需要先做一次风险评估再决定能不能转。
- 没结果会说出来:“仅表格”模式如果一行表格也没找到,工具会明确提示并指出该改哪个设置,而不是丢给你一个空文件。
- 无水印、免注册:支持18种语言界面,不加水印,不要求登录,也不需要API密钥。文件体积偏大时可以先用PDF压缩工具处理一轮,再做提取。
核心功能与可调设置
设置项只有四组,每一组都对应一个真实存在的取舍,而不是为了凑功能列表。
- 输出格式:Excel(.xlsx)或CSV。默认输出Excel工作簿,因为只有它能保住数字类型;需要喂给脚本或数据库时CSV更省事。
- 提取范围:全部内容或仅表格。默认全部内容。
- 扫描页处理:文本PDF或读取扫描件(OCR)。默认按文本PDF处理,OCR需要手动开启。
- 版面组织:每页一个工作表,或全部合并为一个工作表。默认每页一个工作表,便于逐页核对;跨页的连续长表格适合合并。
- 换行单元格完整保留:一个单元格里的多行文字会被作为整体保留,不会在换行处被截断。
- OCR基于Tesseract:识别在服务器端完成,不调用任何第三方AI接口,也不涉及大模型。
需要反向操作时,用Excel转PDF工具把整理好的表格转回归档格式;演示材料里的表格则可以配合PDF转PPT工具或PDF转JPG工具一起使用。
使用方法
- 选择文件。把PDF拖进页面,或点击选取。文件在浏览器内存中打开,此时没有任何网络请求。
- 确认设置。第一次转换建议保持默认,先看看完整版面提取出来是什么样,再决定要不要切到“仅表格”。
- 扫描件才开OCR。如果预览里一个字都取不出来,说明这份PDF没有文本层,此时才需要开启OCR。DocPivot会在按钮上方提示该操作需要上传文件。
- 下载并核对。拿到工作簿后先选中一列数字看状态栏的求和值,确认类型正确;如果用了OCR,再重点核对一遍表头。
页数很多的文件,可以先用PDF拆分工具切出需要的区间,或者反过来用PDF合并工具把分散的月报拼成一份再统一提取。
什么时候适合用它
- 财务对账:银行流水、供应商对账单多以PDF下发,需要转成可计算的表格才能与账面核对。
- 跨境电商结算:亚马逊、速卖通等平台的结算单和物流账单常为PDF,要拆解成SKU维度做毛利测算。
- 招投标与商务分析:标书里的报价表需要横向比价,手工录入既慢又容易错行。
- 研究与统计:年报、行业报告、政府公开数据里的统计表,需要提取后重新建模。
- 历史档案数字化:只有扫描件的旧凭证和台账,靠OCR恢复成结构化数据。
- 数据搬迁:从旧系统导出的PDF报表需要重新灌进新的ERP或BI工具。
只需要取其中几页的时候,PDF提取页面工具比整份转换更省时间;页序混乱的扫描件则建议先用PDF页面整理工具排好顺序。
实际使用场景
深圳外贸公司的月度对账
背景:一家做3C配件出口的公司,每月从货代拿到二十多页PDF账单,此前由文员逐行录入Excel,两天工作量,还经常在小数点上出错。
操作:整份PDF一次转换,保持默认的“每页一个工作表”,下载后把各页数据粘进同一张汇总表,用运单号做VLOOKUP匹配系统内的记录。
效果:录入环节从两天压缩到半小时,且金额列直接可求和,差异比对由公式完成,人只负责看差异项。
会计师事务所的凭证数字化
背景:客户提供的2019年之前的费用台账只有扫描版PDF,没有文本层,常规转换工具取出来是空白。
操作:开启OCR读取扫描页,转换后逐张核对表头文字,金额列抽样复核。破损或页面倾斜的文件先经PDF修复工具与PDF旋转工具处理再进入流程。
效果:数据值识别准确,表头有个别字符需要人工订正,整体比重新录入快得多,且原始扫描件保持不变。
独立站运营的竞品价格整理
背景:做外贸独立站的运营需要把供应商发来的PDF报价单整理成比价表,供应商格式各不相同,有的带框线,有的纯靠空格对齐。
操作:统一用“仅表格”模式提取,去掉抬头和落款,表头直接落在第1行,再合并成一张总表做条件格式标色。
效果:不同来源的报价单被拉平成同一结构,比价工作从版式整理变成纯粹的数据筛选。
能力边界:这些情况它做不到
把限制写清楚,比事后解释更有价值。以下都是实测中确认存在的边界。
- 不是每份PDF都能识别出网格。版面极不规则的文档,提取器可能找不到可用结构。此时工具会给出提示并指明该调整哪个设置,而不是输出一个空文件——默认保留全部内容正是出于这个考虑,因为一个悄悄返回空结果的工具,和一个坏掉的工具无法区分。
- “仅表格”可能什么都找不到。如果整页内容都被判定为单格行,切换到该模式后结果为空,工具会明确说明。
- OCR对数字可靠,对表头不完美。在一份150 DPI、无文本层的扫描件上实测,20个数据值全部正确,但有一个表头单元格把Q1读成了Qi。用OCR之后请务必核对表头。
- 合并单元格保留位置,不保留合并关系。跨两列的表头会落在其中第一列的上方,多级表头的层级结构不会被还原。
- OCR需要上传文件。这是本页唯一会离开设备的操作,识别由服务器上的Tesseract完成。其余所有功能都不上传。
- 它不修改原文件。需要改动PDF本身的内容或页面,应使用PDF编辑器或PDF删除页面工具。
与常见工具的差别
| 对比项 | DocPivot | Sejda | iLovePDF |
|---|---|---|---|
| 免费额度 | 无限制 | 10页、50 MB、每小时3次 | 未明确说明 |
| 输出格式 | Excel与CSV | Excel与CSV | 仅Excel |
| 非表格内容 | 默认保留,一键丢弃 | 模式切换被忽略 | 默认丢弃 |
| 扫描件OCR | 免费 | 不支持 | 需付费版 |
| 是否上传 | 仅OCR时上传 | 始终上传 | 始终上传 |
这张表里最关键的一行是最后一行。免费额度和格式支持可以随时调整,处理位置却是架构决定的,改不了。
数据处理方式与合规考量
除OCR之外,全部解析在你自己的浏览器里完成,PDF内容不经过任何服务器,也就不存在服务端留存、备份或跨境传输的问题。对照《个人信息保护法》,处理个人信息应遵循最小必要原则;对照《数据安全法》,企业需要对数据在处理过程中的流向负责。当文件根本没有离开设备时,这两条要求在技术层面就已经满足,无需依赖服务商的承诺或事后审计。
这一点对经手工资表、客户名单、供应商合同的团队有实际意义:不必为了转换一份表格,先走一遍供应商安全评估流程。需要开启OCR时,务必先确认文件里是否包含敏感信息,因为这一步确实会把文件传到服务器。涉及对外分发的文档,可以配合PDF扁平化工具固定内容,或用PDF加密工具设置访问密码。
常见问题
可以。数字被写成数值型单元格,不是带引号的文本。用LibreOffice实测验证过,工作表XML中B3记录为NUM 1240,选中整列即可看到求和结果,不需要分列或选择性粘贴。
因为CSV会丢失数据类型。像1,240这样含千位分隔符的值在CSV里必须加引号,Excel读到引号就按文本处理,SUM返回0。需要CSV时可以在设置里选择,但默认输出Excel工作簿是为了让结果直接可用。
可以,开启OCR即可。扫描件没有文本层,普通提取取不到内容,需要先做光学字符识别,也可以先用PDF文字识别工具给原件加上文本层。这项功能免费提供,同类产品通常放在付费版里。
数据值准确,表头需要复核。在一份150 DPI的无文本层扫描件上实测,20个数据值全部正确,一个表头单元格把Q1识别成了Qi。建议转换后重点检查表头行。
只有开启OCR时才会上传。其他所有操作都在浏览器内完成,PDF内容不经过服务器。开启OCR前,按钮上方会明确提示这一点。
没有。解析在本地完成,不占用服务器资源,因此不设页数上限和体积上限。三百页的年报和两页的对账单处理方式相同。
它会丢掉标题、段落、脚注这些单格行,让真正的表头落在第1行。适合需要把结果直接当作数据源做透视表的场景。默认关闭,因为并非所有PDF都适用。
工具会给出提示,并说明应该调整哪个设置。这是刻意设计的行为,因为返回空文件会让人无法判断是文档没有表格,还是工具出了故障。
位置会保留,合并关系不会。跨两列的表头会落在第一列的上方,多层嵌套的表头结构需要在Excel里手动重建。
跨页的连续长表格建议选“全部合并为一个工作表”,逐页核对场景则保持默认的每页一个工作表。只需要其中一段时,先截取页面范围再提取,比整份转换更快。
都不需要。打开网页即可使用,不要求登录,不加水印,不需要API密钥,界面支持18种语言。
能。识别依据是文本的坐标关系,不是表格框线,靠空格和缩进对齐排版的财务报表同样可以还原成网格。
可以先压缩PDF体积再转换,或者拆分成几个较小的文件分批处理。本地解析受设备内存影响,低配设备处理超大文件时会慢一些。
需要按文件内容判断。OCR会把文件上传至服务器由Tesseract识别,若文档含个人信息或商业秘密,建议先评估再使用。不开启OCR时,文件始终留在本地设备。
