PDF页面提取,就是把一份PDF里你需要的那几页单独拿出来,另存成一份新文件,原文件一个字都不动。一份四十页的投标文件,对方只要第8到第12页的资质证明,把整份发过去既不专业也不安全,提取这五页才是正常做法。DocPivot的PDF页面提取工具整个过程都在浏览器里跑完,文件不上传服务器,点缩略图选页和直接敲页码两种方式都支持,原文档的书签也会跟着保留下来。如果你想要的其实是把一份大文件切成好几份,那属于拆分PDF,和提取不是同一件事。
提取、拆分、删除页面,你要的到底是哪个
三者的区别在于原文件动不动、输出几个文件。提取页面是从原文档挑出指定页,生成一份新PDF,原件保持原样;拆分是把一份文件切成若干份,每份都是原文的一段,加起来还是完整的原文;删除PDF页面则是去掉不要的几页,把剩下的全部留下。
判断方法很简单:想清楚你最后要几个文件,以及要保留的页多还是要扔掉的页多。
- 要的页少:四十页里只要五页,用提取,敲一次页码就完事。
- 要扔的页少:四十页里去掉封面和空白页,用删除更省事。
- 要好几个文件:把一份合同按章节切成三份分别发给三个人,用拆分。
- 只是顺序不对:页数没变只是排错了,那就调整PDF页面顺序,不需要提取。
国内不少工具把这几件事塞进同一个“分割”入口,用户绕半天才发现自己点错了功能。DocPivot把提取单独做成一个页面,进来就是选页、确认、下载三步。
DocPivot PDF页面提取工具是怎么工作的
核心机制
工具用pdf.js在浏览器里读取并渲染PDF,再用pdf-lib把你选中的页复制进一份新文档。整个读写过程发生在当前标签页内,文件从头到尾没有离开你的电脑或手机。输出默认是一份合并好的PDF,勾选选项后也可以让每一页各自成为一份PDF、打包成ZIP下载。原文档的书签会按存活下来的页重新映射,指向被删掉那些页的书签会被清理掉,不会留下点了没反应的空条目。
适合谁用
最常用到它的是投标专员、行政和人事、财务、律师、老师和研究生。这些岗位手上的PDF有两个共同点:页数多,而且里面混着不该外传的内容。银行流水、员工花名册、病历、尽调报告,这类文件一旦上传到陌生服务器,风险就不在自己手里了。
它解决的问题
过去要从PDF里抽几页,要么装几百块的桌面软件,要么把文件传到在线站点、等排队、下载完再去删记录。WPS的提取页面功能对会员开放,Acrobat按年订阅,而免费在线工具普遍要上传。浏览器本地处理把这两条路都绕开了:不花钱,也不交出文件。抽完的页如果要发微信或者邮件,再过一道PDF压缩就行;如果是要把好几份抽出来的文件拼起来,接着用PDF合并。
这个工具的主要优势
- 文件不出设备:解析、选页、重建全在浏览器内存里完成,没有上传环节,也就没有服务器留存记录这回事。
- 动手前先对一遍:面板会把它读到的页码原样念回来,比如“将保留3页:2、4、7”,你确认无误再按下一步。
- 输错会被点名:解析不了的内容会被明确指出来,而不是悄悄跳过。很多工具遇到错误输入会默默回退到第1页,生成一份看起来正常、内容却完全不对的文件。
- 顺序听你的:你输入5,1,3,拿到的就是第5页、第1页、第3页这个顺序,工具不会擅自把它排回文档原顺序。
- 书签跟着走:论文、电子书、标书这类带目录的文档,抽出来的部分仍然能靠左侧书签跳转。
- 一次按完:选好页直接出结果,不需要先转换再下载这种两段式流程。
- 免费且不限次:不注册、不登录、没有每天三次的额度,也不会在输出文件上打水印。真要加水印,那是PDF加水印工具的活儿。
- 手机也能用:浏览器打开就是完整功能,出差路上用手机抽两页发出去,不用开电脑。
核心功能
- 缩略图选页:每一页都渲染成缩略图,点一下选中,再点一下取消。
- 连续选中:按住Shift点击首尾两页,中间的全部选上;Ctrl或Command加A是全选。
- 页码输入:不想翻缩略图就直接敲,支持单页、区间和开放区间三种写法混着用。
- 开放区间:输入15-表示从第15页一直到最后一页,页数不确定的长文档特别好使。
- 奇偶页选择:一键选中全部奇数页或偶数页,双面扫描件分正反面时用得上。
- 执行前预览:按下按钮之前,面板用文字说明它准备做什么,包括保留的页数和具体页码。
- 自定义顺序:输入顺序即输出顺序,重排和提取一步完成。
- 逐页拆成ZIP:勾上选项,选中的每一页各自成为一份独立PDF,打包下载。
- 书签重映射:保留原文档目录结构,失效的条目自动清除。
- 链接清理:指向已被剔除页面的内部跳转会被处理掉,不会拖出多余内容。
- 结果信息:下载前显示页数和文件体积,心里有数再存盘。
- 多语言界面:界面提供18种语言,中文环境下所有提示都是中文。
提取完如果发现页边距太大影响打印,可以再用PDF裁剪工具修一下;夹在中间的空白页交给删除空白页处理;扫描件方向躺倒了,先用PDF旋转工具摆正再提取。
使用方法
- 打开文件。把PDF拖进页面或者点击选择,浏览器本地读取,没有上传进度条。
- 挑选页面。点缩略图,或者在输入框里敲页码,两种方式可以换着来。
- 核对提示。看一眼面板给出的那句确认,页码对得上再往下走。
- 选择输出形式。默认一份PDF;要每页一个文件就勾选拆分成ZIP的选项。
- 下载保存。点下载,文件直接存到本地。需要接着编辑内容的话,转到DocPivot的PDF编辑器继续。
页码的四种写法
输入框接受四种格式,可以在同一行里混用,用逗号或者分号隔开。
| 写法 | 含义 | 示例 |
|---|---|---|
| 单页 | 指定某几页 | 3,5,7 |
| 闭区间 | 连续的一段 | 1-4 |
| 开放区间 | 从某页到末尾 | 15- |
| 混合写法 | 三种组合使用 | 1-4,8,15- |
两个实际会踩到的细节。一是连字符“-”和短横线“–”都能识别,因为Word和WPS的自动更正常常会把手打的连字符替换成短横线,很多工具因此直接报错。二是中文输入法默认打出的是全角逗号“,”,输入页码前建议切到英文状态,用半角逗号最稳妥。万一格式不对,工具会明确告诉你哪一段没读懂,不会硬着头皮给你一份错文件。提取完想给新文件重新编号,用添加页码工具补上就行。
什么时候该用它
只要“这份文件里我只需要其中几页”这个念头出现,就该用提取。它在两种情况下价值最高:一是原文件太大不方便传输,二是原文件里有不该给对方看的内容。
- 投标应答:招标方只要营业执照和资质页,从整本标书里抽出来单独提交。
- 报销贴票:几十页的对账单里只有三笔需要报销,抽出那三页交财务。
- 签证材料:银行要求提供近六个月流水,从全年流水PDF里按月份区间提取。
- 合同协商:只把补充条款那两页发给对方确认,正文不外传。
- 教学讲义:从教材PDF里抽出本周要讲的章节,发到班级群。
- 论文引用:从上百页的年鉴里提取需要引用的表格页存档。
- 简历投递:作品集太厚,按岗位抽出相关的几个项目页。
- 双面打印:先提取奇数页打一面,再提取偶数页打另一面。
如果对方只是要看看内容、不需要PDF格式,把这几页转成图片发过去往往更方便。
几个真实场景
投标资质单独提交
背景:某工程公司投标,招标平台要求资质文件单独上传,限制20MB。
操作:打开86页的标书PDF,输入32-38,核对提示显示“将保留7页”,下载。
效果:七页的资质文件几秒钟出来,标书原件没有任何改动,也不存在整本标书被传到第三方服务器的问题。
财务对账单摘录
背景:季度对账单一百多页,会计只需要其中涉及三个供应商的页面。
操作:按缩略图逐页点选,共选中九页,输出成一份PDF。
效果:九页的摘录直接进入报销流程。若其中有银行卡号需要遮挡,接着用PDF涂黑工具处理再发出去。
教师制作课堂讲义
背景:教材PDF有四百多页,老师要把本周两个章节发给学生。
操作:输入112-126,140-151,两段区间一次提取。
效果:二十六页的讲义发到班级群,学生手机上直接看。原书的章节书签也跟着保留,学生能靠目录跳转。
合同条款定向发送
背景:采购合同三十页,只有付款条款需要发给对方法务确认。
操作:提取第18到19页,下载后确认无误。
效果:对方只看到该看的两页。定稿阶段再用PDF电子签名完成签署,全流程文件都没上传过公网。
提取之后可能遇到的三件事
有三个结果经常让人意外,提前知道就不会白折腾。
体积不一定变小。从一百页里抽一页,文件不会变成原来的百分之一,有时甚至和原件差不多大。原因在于PDF的字体和图片资源挂在文档层面、多页共用,抽走一页可能把整套资源都带过来。PDF24官方论坛上就有用户反馈,从106页、约13MB的文档里提取一页,结果拿到13MB出头的新文件。真要减体积,提取完再走一次压缩到指定大小。
表单填写框会消失。PDF的表单定义存在文档这一级,不是存在某一页上,所以提取出来的文件会丢掉可填写的输入框,页面上的文字和框线还在,但点进去没法录入。需要保留填好的内容的话,先把表单扁平化处理,再做提取。
超大文档在手机上会卡。渲染几百张缩略图很吃内存,手机上处理五百页的文档容易变慢甚至崩掉。绕过办法是不看缩略图,直接输入页码,工具就不必渲染整本。
和常见免费提取工具的差别
| 对比项 | 本工具 | 常见免费工具 |
|---|---|---|
| 处理位置 | 浏览器本地 | 上传到服务器 |
| 选页方式 | 缩略图和页码输入都支持 | 通常只有一种 |
| 开放区间 | 支持15-这样的写法 | 多数不接受 |
| 奇偶页 | 支持 | 少见 |
| 执行前预览 | 动手前用文字说清楚 | 做完才知道 |
| 输入有误 | 点名指出并拒绝 | 常常悄悄忽略 |
| 书签 | 保留并重新映射 | 基本丢失 |
| 操作步数 | 一步出结果 | 常需两步 |
| 费用 | 免费不限次 | 免费额度或会员制 |
这张表里最该看的是“输入有误”那一行。工具悄悄回退到第1页,问题不在于少了一个功能,而在于它给了你一份看着正常的PDF,等你发出去才发现页码全错。
数据安全和合规
文件不离开设备,就不存在向第三方传输的环节。按《个人信息保护法》的最小必要原则,处理简历、体检报告、身份证复印件这类含个人信息的PDF时,能不外传就不外传是更稳妥的做法。浏览器本地处理在技术上直接去掉了传输和留存两个风险点,不用去核对某家服务商的删除承诺是不是真的执行了。如果文件本身需要加访问口令,用PDF加密工具单独处理,同样在本地完成。
常见问题
提取是挑出你要的页生成一份新文件,拆分是把一份文件切成多份。要几页就用提取,要把整本分成几段就用拆分。
不会。提取是把整页内容原样复制进新文档,不涉及重新排版或者重新渲染,字体、间距、图片位置都和原文一致。这也是PDF作为固定版式格式的设计初衷。
因为PDF的字体和图片资源是多页共用的,挂在文档层面而不是某一页上。抽出一页有可能把整套资源一起带走,所以体积不会按页数比例缩小。需要减小体积就再压缩一次。
在。书签会按保留下来的页重新映射,指向被剔除页面的条目会被删掉,不会留下点了没反应的死链接。这一点多数免费工具做不到。
可以。输入5,1,3拿到的就是这个顺序,工具不会把它排回文档原来的先后。相当于提取和重排一次完成。
工具会把无法解析的部分点出来并拒绝执行,不会替你猜。这和那些默默回退到第1页的工具不同,后者会生成一份看起来没问题、内容却不对的文件。
能,浏览器打开就是完整功能。只是几百页的大文档渲染缩略图比较吃内存,手机上建议直接输入页码,跳过缩略图那一步。
支持,奇数页和偶数页各有一个按钮。双面扫描后需要分正反面处理的时候用得最多。
不会。解析和重建都在浏览器内存里完成,全程没有上传动作,也没有服务器端的临时文件。
需要先解除限制。带打开口令或编辑限制的文件无法直接读取页面内容,可以先用PDF解密工具处理,再回来提取。
不能。扫描件本质上是图片,提取只是把图片页搬进新文档,文字仍然不可选中。想要可搜索的文本,先做一次OCR识别。
PDF的表单定义存放在文档级别而非页面级别,所以页面被复制到新文档时,可填写字段不会跟过来。需要保留已填内容的话,先做扁平化再提取。
免费,不需要注册、不需要登录,也没有每天几次的限制,输出文件上不带水印。
没有固定上限,实际能力取决于设备内存和浏览器。几百页的文档在电脑上通常没问题;手机上处理超大文件时,用页码输入代替缩略图选择会稳定很多。整理好之后如果还要把内容转成可编辑格式,可以用PDF转Word接着处理。
