先判断文档类型,再选择压缩档位
OmniKit 的 PDF 压缩会先渲染每一页,再编码为 JPEG,并用这些页面图片生成新 PDF。扫描件可能因此变小;原本高效的文字文档却可能变成更大的图片文件,文字也不再能选择和搜索。“压缩完成”只表示处理已结束,是否适合使用还需要看结果。
这里提供两份 OmniKit 原创的单页练习文档,页面均为 540 × 720 PDF 点。图片型样本只包含一张页面图片;文字型样本包含可搜索文字。两份文件均不含真实客户或个人资料。
参考运行的具体结果
| 文档 | 原文件字节数 | 输出字节数 | 可选择文字 |
|---|---|---|---|
| 图片型页面 | 195,313 | 144,075 | 前后均无 |
| 文字型页面 | 1,487 | 62,166 | 原件有,输出无 |
这组参考输出使用工具“均衡”档位的参数:132 DPI、JPEG 画质 0.75。图片型样本变小了,文字型样本则显著变大。两个输出都保留一页和原页面尺寸。你可以在文字型原件中搜索 OK-2026-0905,再在其输出副本中重复搜索,观察差别。
在工具里亲自复现
- 打开 PDF 压缩工具,添加图片型原件,选择“均衡”并压缩。记录两份文件的大小,再放大检查小字。
- 换成文字型原件。内容分析应检测到可搜索文字;先阅读扁平化提醒,再确认是否接受纯图片副本。
- 压缩并下载文字型样本,尝试选中文字或搜索上面的编号。
- 将原件和输出放在一起比较。输出更大,或丢失了需要的能力时,应保留并使用原件。
根据接下来的任务选择工具
| 实际需求 | 建议下一步 |
|---|---|
| 减小扫描件便于发送 | 先压缩,再逐页检查清晰度 |
| 保留文字搜索或复制表格 | 保留原文件;当前压缩流程不保留文字层 |
| 调整顺序或删除页面 | 使用 PDF 页面整理,导出后检查 |
| 把扫描件变成可编辑文字 | 使用 OCR,核对姓名、金额、标点与阅读顺序 |
| 保留表单、链接或证书签名 | 保留原件;图片化压缩会扁平化这些内容 |
OCR 可以把可见文字识别为草稿,但无法恢复原表单字段、链接或证书数字签名。文件再小,如果无法完成收件人需要的任务,也不是合适的结果。每次导出新副本,在验收之前都应保留原件。