PDF 转 Excel v1.0

把 PDF 里的表格变成 Excel 能打开的电子表格

把PDF里的表格搬进Excel,难点从来不是打开文件,而是打开之后能不能直接求和。市面上不少在线转换器给出的所谓Excel文件,实质是把每一个单元格都当成文本写进去:1,240在屏幕上长得像数字,选中一整列却算不出合计,只能一格一格重新敲。DocPivot的PDF转Excel在浏览器内完成解析,输出标准的Excel工作簿(.xlsx),数字以数值单元格写入,扫描件可以免费用OCR读取,不限页数、不限文件体积;除非你主动开启OCR,文件不会离开你的设备。

它真正解决的是哪个问题

核心问题出在CSV这种格式本身。表格里一个写着1,240的单元格,导出成CSV时必须加引号包起来,否则那个千位逗号会把一个字段劈成两个。加了引号之后,Excel打开它就按文本处理,SUM函数返回0,右上角挂一个绿色小三角提示“数字以文本形式存储”。财务和运营人员每天都在跟这个绿三角打交道,解决办法通常是分列、选择性粘贴、乘以1,一套操作下来比手工重录快不了多少。

写入真正的工作簿就绕开了这一层。.xlsx的本质是一个ZIP包,里面装着描述每个工作表的XML,单元格在XML里有明确的类型标记:数值就是数值,字符串就是字符串。这个差别在实测中可以直接验证——用LibreOffice打开生成的工作簿,1240以数字形式返回,工作表XML里B3记为NUM 1240,同一行的A3记为TXT North。类型是写在文件结构里的,不依赖打开它的软件去猜。

如果你的目标只是把PDF内容取出来编辑,而不是做计算,那么PDF转Word工具或者更轻量的PDF转文本工具可能更合适。表格转Excel要处理的是另一类需求:结果必须能参与运算。

工作原理:从坐标到网格,再到工作簿

整个流程分四步,全部在浏览器里跑完。

第一步,读取页面。内置的pdf.js 6.2.108返回页面上每一段文本及其坐标。PDF文件格式里其实没有“表格”这个概念,只有一堆带位置信息的文字片段,所谓表格是人眼在版面上看出来的结构。这一步不上传任何内容。

第二步,重建网格。文本片段按基线聚类成行,按x坐标聚类成列,于是版面上的表格重新变回一张网格。这套方式不依赖表格框线,所以那些没有画线、只靠对齐排版的财务报表和对账单同样能被识别出来——这类PDF恰恰是纯框线检测方案最容易失手的地方。

第三步,按需只保留表格。页面的标题、正文段落、脚注在网格里会变成只有一格的行。默认全部保留;切到“仅表格”模式后,这些单格行被丢掉,真正的表头就落在第1行,拿到手就能直接透视或做数据源。

第四步,写出工作簿。工作表以XML形式打包进ZIP,用引擎里已有的ZIP写入模块生成,整个工作簿写入器大约200行代码,没有引入任何电子表格库。数字写成数值单元格,其余内容写成内联字符串。最后交付一个Excel工作簿——每页一个工作表,或者全部合并为一个工作表,也可以直接要CSV。

核心优势

  • 数字就是数字:输出的是可求和、可做透视表的数值单元格,不是一堆需要二次清洗的文本。
  • 扫描件免费识别:OCR不设付费墙,而同类产品普遍把扫描件识别放进会员权益里。DocPivot把它作为默认可用的选项,只是在按钮上方明确标注这一步需要上传。
  • 不限页数与体积:解析在本地完成,没有服务器成本,也就没必要设10页或50MB这样的门槛。三百页的年报和两页的对账单走同一条路径。
  • 本地处理:除OCR外的全部流程在浏览器内存中完成,文件不上传、不留存。合同、工资表、客户名单这类材料不需要先做一次风险评估再决定能不能转。
  • 没结果会说出来:“仅表格”模式如果一行表格也没找到,工具会明确提示并指出该改哪个设置,而不是丢给你一个空文件。
  • 无水印、免注册:支持18种语言界面,不加水印,不要求登录,也不需要API密钥。文件体积偏大时可以先用PDF压缩工具处理一轮,再做提取。

核心功能与可调设置

设置项只有四组,每一组都对应一个真实存在的取舍,而不是为了凑功能列表。

  • 输出格式:Excel(.xlsx)或CSV。默认输出Excel工作簿,因为只有它能保住数字类型;需要喂给脚本或数据库时CSV更省事。
  • 提取范围:全部内容或仅表格。默认全部内容。
  • 扫描页处理:文本PDF或读取扫描件(OCR)。默认按文本PDF处理,OCR需要手动开启。
  • 版面组织:每页一个工作表,或全部合并为一个工作表。默认每页一个工作表,便于逐页核对;跨页的连续长表格适合合并。
  • 换行单元格完整保留:一个单元格里的多行文字会被作为整体保留,不会在换行处被截断。
  • OCR基于Tesseract:识别在服务器端完成,不调用任何第三方AI接口,也不涉及大模型。

需要反向操作时,用Excel转PDF工具把整理好的表格转回归档格式;演示材料里的表格则可以配合PDF转PPT工具PDF转JPG工具一起使用。

使用方法

  1. 选择文件。把PDF拖进页面,或点击选取。文件在浏览器内存中打开,此时没有任何网络请求。
  2. 确认设置。第一次转换建议保持默认,先看看完整版面提取出来是什么样,再决定要不要切到“仅表格”。
  3. 扫描件才开OCR。如果预览里一个字都取不出来,说明这份PDF没有文本层,此时才需要开启OCR。DocPivot会在按钮上方提示该操作需要上传文件。
  4. 下载并核对。拿到工作簿后先选中一列数字看状态栏的求和值,确认类型正确;如果用了OCR,再重点核对一遍表头。

页数很多的文件,可以先用PDF拆分工具切出需要的区间,或者反过来用PDF合并工具把分散的月报拼成一份再统一提取。

什么时候适合用它

  • 财务对账:银行流水、供应商对账单多以PDF下发,需要转成可计算的表格才能与账面核对。
  • 跨境电商结算:亚马逊、速卖通等平台的结算单和物流账单常为PDF,要拆解成SKU维度做毛利测算。
  • 招投标与商务分析:标书里的报价表需要横向比价,手工录入既慢又容易错行。
  • 研究与统计:年报、行业报告、政府公开数据里的统计表,需要提取后重新建模。
  • 历史档案数字化:只有扫描件的旧凭证和台账,靠OCR恢复成结构化数据。
  • 数据搬迁:从旧系统导出的PDF报表需要重新灌进新的ERP或BI工具。

只需要取其中几页的时候,PDF提取页面工具比整份转换更省时间;页序混乱的扫描件则建议先用PDF页面整理工具排好顺序。

实际使用场景

深圳外贸公司的月度对账

背景:一家做3C配件出口的公司,每月从货代拿到二十多页PDF账单,此前由文员逐行录入Excel,两天工作量,还经常在小数点上出错。

操作:整份PDF一次转换,保持默认的“每页一个工作表”,下载后把各页数据粘进同一张汇总表,用运单号做VLOOKUP匹配系统内的记录。

效果:录入环节从两天压缩到半小时,且金额列直接可求和,差异比对由公式完成,人只负责看差异项。

会计师事务所的凭证数字化

背景:客户提供的2019年之前的费用台账只有扫描版PDF,没有文本层,常规转换工具取出来是空白。

操作:开启OCR读取扫描页,转换后逐张核对表头文字,金额列抽样复核。破损或页面倾斜的文件先经PDF修复工具PDF旋转工具处理再进入流程。

效果:数据值识别准确,表头有个别字符需要人工订正,整体比重新录入快得多,且原始扫描件保持不变。

独立站运营的竞品价格整理

背景:做外贸独立站的运营需要把供应商发来的PDF报价单整理成比价表,供应商格式各不相同,有的带框线,有的纯靠空格对齐。

操作:统一用“仅表格”模式提取,去掉抬头和落款,表头直接落在第1行,再合并成一张总表做条件格式标色。

效果:不同来源的报价单被拉平成同一结构,比价工作从版式整理变成纯粹的数据筛选。

能力边界:这些情况它做不到

把限制写清楚,比事后解释更有价值。以下都是实测中确认存在的边界。

  • 不是每份PDF都能识别出网格。版面极不规则的文档,提取器可能找不到可用结构。此时工具会给出提示并指明该调整哪个设置,而不是输出一个空文件——默认保留全部内容正是出于这个考虑,因为一个悄悄返回空结果的工具,和一个坏掉的工具无法区分。
  • “仅表格”可能什么都找不到。如果整页内容都被判定为单格行,切换到该模式后结果为空,工具会明确说明。
  • OCR对数字可靠,对表头不完美。在一份150 DPI、无文本层的扫描件上实测,20个数据值全部正确,但有一个表头单元格把Q1读成了Qi。用OCR之后请务必核对表头。
  • 合并单元格保留位置,不保留合并关系。跨两列的表头会落在其中第一列的上方,多级表头的层级结构不会被还原。
  • OCR需要上传文件。这是本页唯一会离开设备的操作,识别由服务器上的Tesseract完成。其余所有功能都不上传。
  • 它不修改原文件。需要改动PDF本身的内容或页面,应使用PDF编辑器PDF删除页面工具

与常见工具的差别

对比项DocPivotSejdaiLovePDF
免费额度无限制10页、50 MB、每小时3次未明确说明
输出格式Excel与CSVExcel与CSV仅Excel
非表格内容默认保留,一键丢弃模式切换被忽略默认丢弃
扫描件OCR免费不支持需付费版
是否上传仅OCR时上传始终上传始终上传

这张表里最关键的一行是最后一行。免费额度和格式支持可以随时调整,处理位置却是架构决定的,改不了。

数据处理方式与合规考量

除OCR之外,全部解析在你自己的浏览器里完成,PDF内容不经过任何服务器,也就不存在服务端留存、备份或跨境传输的问题。对照《个人信息保护法》,处理个人信息应遵循最小必要原则;对照《数据安全法》,企业需要对数据在处理过程中的流向负责。当文件根本没有离开设备时,这两条要求在技术层面就已经满足,无需依赖服务商的承诺或事后审计。

这一点对经手工资表、客户名单、供应商合同的团队有实际意义:不必为了转换一份表格,先走一遍供应商安全评估流程。需要开启OCR时,务必先确认文件里是否包含敏感信息,因为这一步确实会把文件传到服务器。涉及对外分发的文档,可以配合PDF扁平化工具固定内容,或用PDF加密工具设置访问密码。

常见问题

报告问题

联系我们

info@toolspivot.com

地址

Ward No.1, Nehuta, P.O - Kusha, P.S - Dobhi, Gaya, Bihar, India, 824220

最受欢迎的工具