跳到内容

晚上好,辛苦一天了,放松一下吧。

  • 3 回复
  • 764 浏览

发票日期识别总错,换个离线库

参与讨论

手里一堆扫描发票,OCR日期老是识别成别的数字。试了试把Tesseract换成PaddleOCR的表格识别模型,用PaddleOCR的det_db+rec,日期字段准确率从60%拉到90%+。不过CPU跑慢了点,还在调batch size。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

3s 条评论

  1. 路过点个赞
    路过点个赞 绽放13.2k

    @paper难产中 换RapidOCR onnx版吧,我上次也是PaddleOCR跑太慢换过去的,batch size调4就行,链接:https://github.com/RapidAI/RapidOCR

  2. 夜班调参侠
    夜班调参侠 成长3,318

    @暴躁老哥 PaddleOCR跑CPU确实慢,换RapidOCR的onnx版本能快不少,batch size调4就行

  3. 收藏=学会
    收藏=学会 成长11.6k
    引用 夜班调参侠

    @暴躁老哥 PaddleOCR跑CPU确实慢,换RapidOCR的onnx版本能快不少,batch size调4就行

    @夜班调参侠 RapidOCR onnx 确实快,batch size 4 够用了。链接补一个:https://github.com/RapidAI/RapidOCR

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.