跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 6 回复
  • 721 浏览

求个能离线跑OCR且带表格还原的脚本

参与讨论

纸质发票太多,手打太慢。之前试过百度API,隐私顾虑太大。求本地能跑的OCR方案,重点是要能识别发票里的表格内容,导出Excel格式。PaddleOCR有现成的表格识别模块推荐吗?版本别太老,要能稳定运行的。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

6s 条评论

  1. 接口又500
    接口又500 成长10.1k

    @佛系打工人 RapidOCR 8.0+ 确实稳,但表格还原还得靠 pdfplumber 提取结构,纯 OCR 硬转 Excel 必崩。

  2. 匿名圈友A
    匿名圈友A 成长3,962
    引用 接口又500

    @佛系打工人 RapidOCR 8.0+ 确实稳,但表格还原还得靠 pdfplumber 提取结构,纯 OCR 硬转 Excel 必崩。

    RapidOCR + tabulizer 思路确实靠谱,马克一下。发票这种规整表格用 pdfplumber 提取结构确实更稳,纯 OCR 硬转容易崩,已试水成功。

  3. 法务别找我
    法务别找我 绽放14.4k

    @佛系打工人 别折腾 PaddleOCR 了,那个表格还原简直是灾难现场,经常把单元格合并错乱。私藏一个:使用 RapidOCR 配合 tabulizer 库的思路。RapidOCR 基于 PaddleOCR 优化,速度快且模型轻量,能离线跑;重点是用 tabulizer 做后处理,它对发票这种规整表格的还原率远高于纯 OCR 方案。参数调一下置信阈值,导出 Excel 基本不用怎么修。

  4. 午后续命水
    午后续命水 成长9,188
    引用 法务别找我

    @佛系打工人 别折腾 PaddleOCR 了,那个表格还原简直是灾难现场,经常把单元格合并错乱。私藏一个:使用 RapidOCR 配合 tabulizer 库的思路。RapidOCR 基于 PaddleOCR 优化,速度快且模型轻量,能离线跑;重点是用 tabulizer 做后处理,它对发票这种规整表格的还原率远高于纯…

    @法务别找我 tabulizer 对发票这种非标准表格支持其实很一般,经常漏列。不如直接上 PaddleOCR 自带的 PP-StructureV2 表格解析模块,v2.6+ 版本,专门针对票据优化的,导出就是干净的 CSV,比后处理靠谱多了。

  5. 接口又500
    接口又500 成长10.1k
    引用 午后续命水

    @午后续命水 PP-StructureV2 对发票这种复杂排版其实经常抽风,尤其是多栏混合的时候。样本量够吗?还是得看具体发票模板。

  6. 路过点个赞
    路过点个赞 绽放13.2k
    引用 午后续命水

    @paper难产中 发票用 PP-StructureV2 吧,v2.6+ 自带表格解析,不用自己搞后处理。之前试 tabulizer 对错位表格太头疼,这个直接出 CSV 省事。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.