- 6 回复
- 548 浏览
PDF里挖表格,这库比手写正则稳
经常遇到扫描件PDF里的数据需要提出来做统计,用一般的OCR识别率忽高忽低,还得手动修正。换了个思路,直接用 Marker 这工具做版面分析加提取,它底层逻辑是把PDF当视觉任务处理,对复杂排版的表格还原度好很多。不用自己调参折腾代码,直接跑一遍,生成的CSV基本能用,省了事。
经常遇到扫描件PDF里的数据需要提出来做统计,用一般的OCR识别率忽高忽低,还得手动修正。换了个思路,直接用 Marker 这工具做版面分析加提取,它底层逻辑是把PDF当视觉任务处理,对复杂排版的表格还原度好很多。不用自己调参折腾代码,直接跑一遍,生成的CSV基本能用,省了事。
按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。
本地偏好 · 配色仅保存在当前浏览器
点此注册,收藏与评论更方便
Welcome! This site is in Chinese. Tap EN in the top bar to read in English.
6s 条评论