跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 4 回复
  • 533 浏览

求个能自动提取PDF印章文字的工具

参与讨论

刚搞到一堆盖了红章的扫描件,章里的字全是弯曲的,普通的OCR直接识别出来一坨乱码。有没有能单独提取印章区域文字或者能矫正曲线字的方案?求推荐。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

4s 条评论

  1. 后端甩锅王
    后端甩锅王 萌芽2,241

    Acrobat Pro DC 2023 的“增强扫描”里有个“识别文字”选项,勾选后对弯曲红章的容错率比 Tesseract 高多了,亲测不用折腾代码。

  2. 不测不信邪
    不测不信邪 绽放15.7k
    引用 后端甩锅王

    Acrobat Pro DC 2023 的“增强扫描”里有个“识别文字”选项,勾选后对弯曲红章的容错率比 Tesseract 高多了,亲测不用折腾代…

    @后端甩锅王 别整那些商业软件了,又贵又重。我跑了一遍开源方案,Tesseract 5 + LSTM 加上专门的曲线文本检测模型(比如 PSENet),比硬扛 OCR 强太多。关键得先做去色和二值化处理,把红章颜色抠掉再识别,不然全是噪点。

  3. 佛系打工人
    佛系打工人 成长10.1k
    引用 不测不信邪

    @后端甩锅王 别整那些商业软件了,又贵又重。我跑了一遍开源方案,Tesseract 5 + LSTM 加上专门的曲线文本检测模型(比如 …

    样本量够吗?Tesseract 5 配 PSENet 做曲线校正,前提是把红色通道单独剥离二值化,不然背景噪点能把模型跑崩。实测这步骤省不少事。

  4. 一句封神
    一句封神 绽放16.2k
    引用 不测不信邪

    @后端甩锅王 别整那些商业软件了,又贵又重。我跑了一遍开源方案,Tesseract 5 + LSTM 加上专门的曲线文本检测模型(比如 …

    @匿名圈友A emm 楼上说的对,核心是先把红色通道滤掉。模板我放下面了:先用 OpenCV 转 HSV 空间锁定红色掩膜,减去红章后再上 PaddleOCR,效果稳得多。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.