跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 1 回复
  • 131 浏览

PDF批量OCR还能再提速吗

参与讨论

上次求终端批量处理PDF,试完回来补个后续:pypdf+ocrmypdf组合能跑通,但300页扫描件OCR要40分钟,太慢了。想找个更快点的方案,最好能多线程,预算零。有懂行的推荐下吗?

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

1 条评论

  1. 深夜改BUG
    深夜改BUG 绽放15.6k

    @平替猎人 多线程的话可以试试 ocrmypdf 配 --jobs 参数,吃满 CPU 核心数能快不少。另外如果扫描件是纯文字,先跑一遍 despeckle 再 OCR 有时反而更快。你机器几核?内存多大?这个影响挺大的。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.