经验分享

经验分享与实例解决

这些方法来自真实银行账单解析中常见的问题,按处理顺序排列。

去转换账单
01

先判断账单是什么类型

解析前先判断 PDF 是文字版还是扫描件。文字版可以直接提取;扫描件需要 OCR。

02

有表格线的 PDF:直接识别表格

很多银行账单会绘制水平线和垂直线。系统会先按表格线提取,再清理空单元格,并去掉每一页重复出现的表头。

Date        | Description      | Debit   | Credit  | Balance
2026-07-03  | ACME PAYROLL     |         | 4,500.00| 14,500.00
2026-07-05  | OFFICE RENT      | 2,400.00|         | 12,100.00
03

没有表格线的 PDF:按文字坐标兜底

部分账单只是把文字按固定位置排列,没有可见表格线。此时会先按行拆分,再按文字坐标判断列边界。描述里有空格也不会被拆散,金额空位会保留为空单元格。

2026-07-11  SUPPLIER PAYMENT  3,150.00          15,750.00
2026-07-15  ATM WITHDRAWAL      500.00          15,250.00
2026-07-18  REFUND - TAX                   220.50 15,470.50
04

扫描件:需要 OCR

扫描件只有图片,没有可提取的文字。继续调整表格识别参数不会有效,必须先做 OCR。当前版本会提示“需要 OCR”,避免用户下载空文件。

05

导出安全:金额和公式

银行账单文本来自外部 PDF,导出时必须防止单元格内容被 Excel 当成公式执行。以等号、加号、减号或 @ 开头的文本都会转为纯文本。CSV 使用 UTF-8 BOM,保证中文在 Excel 中不乱码。

06

实例:为什么识别出 0 行

最常见的三个原因:扫描件、页面是图片、账单文字被安全工具转成图片。解决办法依次是接入 OCR、确认文件来源、重新生成文字版 PDF。管理后台会记录转换日志,但不会保存账单文件。