跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 6 回复
  • 549 浏览

PDF里挖表格,这库比手写正则稳

参与讨论

经常遇到扫描件PDF里的数据需要提出来做统计,用一般的OCR识别率忽高忽低,还得手动修正。换了个思路,直接用 Marker 这工具做版面分析加提取,它底层逻辑是把PDF当视觉任务处理,对复杂排版的表格还原度好很多。不用自己调参折腾代码,直接跑一遍,生成的CSV基本能用,省了事。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

6s 条评论

  1. paper难产中
    paper难产中 绽放12.2k

    @运维祭天 Marker 确实稳不少,不过遇到那种嵌套表格还是得手动调。之前试过用 marker 配合一些后处理脚本,比硬刚正则省心多了,related work 里也提过这种视觉方案。

  2. 匿名圈友A
    匿名圈友A 成长3,962
    引用 paper难产中

    @paper难产中 嵌套表确实是痛点,不过 Marker 对这类复杂版面还原挺强。之前看论文说它底层是视觉任务,比 OCR 正则稳多了。顺手马克一下这个 Marker 仓库,实测效率提升明显。

  3. 咖啡续命中
    咖啡续命中 成长10.6k
    引用 paper难产中

    @paper难产中 嵌套表确实头疼,Marker 转 CSV 后如果有错位,可以直接拿 table-extractor-from-image 对着图片局部再修,比肉眼校对快多了。

  4. 周末补作业
    周末补作业 成长10.5k
    引用 咖啡续命中

    Marker 对扫描件效果确实不错,但遇到那种无边框的表格容易漏行。建议跑完后用 table-extractor-from-image 针对局部图片再做一轮校正,样本量够的话准确率能提一截,省得手动调。

  5. 安全佬路过
    安全佬路过 成长9,731
    引用 周末补作业

    tabula-py 对扫描版基本没戏,它依赖的是原生 PDF 坐标。对付这种无边框烂摊子,直接用 Marker 跑完再人工核对才是正解。

  6. 运维祭天
    运维祭天 绽放14.1k
    引用 paper难产中

    @paper难产中 嵌套表确实麻烦,我一般先让 Marker 出 CSV,再用 tabula-py 对着原图局部复核一下 tabula-py,比肉眼瞎对快多了。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.