围绕“OCR识别扫描表格:列结构、数字和合并单元格校对”说明准备条件、完整步骤、关键设置、常见问题和验收方法,适合在压缩与识别场景中按步骤操作。
先明确问题和目标
复制原文件并记录大小、页数和可搜索状态,再压缩或 OCR。 本文的目标是:识别表格后重点恢复列关系并校对数字。 不要在唯一原件或正式数据上直接尝试,先保留可恢复副本。
分步处理方法
- 纠偏并提高扫描对比度。完成后立即观察结果,不要把多个未验证动作一次性叠加。
- 选择正确识别语言。完成后立即观察结果,不要把多个未验证动作一次性叠加。
- 启用表格或版面识别。完成后立即观察结果,不要把多个未验证动作一次性叠加。
- 导出后检查列和合并单元格。完成后立即观察结果,不要把多个未验证动作一次性叠加。
- 逐项校对金额和编号。完成后立即观察结果,不要把多个未验证动作一次性叠加。
检查点怎么设置
| 检查项目 | 本次建议 | 判断依据 |
|---|---|---|
| 步骤 1 | 纠偏并提高扫描对比度 | 围绕“识别表格后重点恢复列关系并校对数字。”检查输入、范围与输出是否对应。 |
| 步骤 2 | 选择正确识别语言 | 围绕“识别表格后重点恢复列关系并校对数字。”检查输入、范围与输出是否对应。 |
| 步骤 3 | 启用表格或版面识别 | 围绕“识别表格后重点恢复列关系并校对数字。”检查输入、范围与输出是否对应。 |
结果异常时怎么查
- 过度压缩会让文字和印章不可读。处理“OCR识别扫描表格:列结构、数字和合并单元格校对”时,应先定位具体记录或页面,再修改单一因素。
- OCR 不能保证数字和专有名词正确。处理“OCR识别扫描表格:列结构、数字和合并单元格校对”时,应先定位具体记录或页面,再修改单一因素。
- 图像层和文字层错位会影响复制顺序。处理“OCR识别扫描表格:列结构、数字和合并单元格校对”时,应先定位具体记录或页面,再修改单一因素。
交付前复核
- 复核“启用表格或版面识别”对应的结果,并与原数据、预览或实际输出进行抽样对照。
- 复核“导出后检查列和合并单元格”对应的结果,并与原数据、预览或实际输出进行抽样对照。
- 复核“逐项校对金额和编号”对应的结果,并与原数据、预览或实际输出进行抽样对照。
- 关闭并重新打开文件或页面,确认结果可以稳定复现,链接、权限和版本状态没有变化。
版本与安全提示
关键文件应保留原扫描件;OCR 和压缩结果都要人工抽查。
参考资料
- PDF 压缩与 OCR 帮助。
- 办公技巧编辑部原创操作记录与交付检查清单。