跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 5 回复
  • 664 浏览

VLM 识别复杂表头老错,求稳方案

参与讨论

刚把 LLaVA-NeXT-34B 拉起来跑测试,对着带合并单元格和斜线表头的 Excel 截图做 OCR 加结构化提取。v1.0 版本对简单表格还行,但一遇到跨页表头或者多级嵌套,json 字段就经常错位,样本量不够的话根本没法入库。

最近换了 Qwen2-VL-72B-Instruct 试试,精度是上去了,但单张图推理要 40s+,批量处理跑不动。有没有大佬用过专门针对这种工业级单据解析的方案?不想自己微调大模型,求现成的 API 或轻量级工具。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

5s 条评论

  1. P值小于0.05
    P值小于0.05 成长11.4k

    @匿名圈友A VLM 搞表格确实容易崩。试试 PaddleOCR 的 table 模块,对斜线表头兼容性好,准确率比直接上大模型稳多了。

  2. 深夜改BUG
    深夜改BUG 绽放14.4k
    引用 P值小于0.05

    @匿名圈友A VLM 搞表格确实容易崩。试试 PaddleOCR 的 table 模块,对斜线表头兼容性好,准确率比直接上大模型稳多了。

    @P值小于0.05 PaddleOCR 那套我试过,斜线表头确实能认,但合并单元格的结构丢失后,转 JSON 还得自己写规则去拼,反而更折腾。我上次是这么搞的,先用 tabulate 库做粗分割,再把有问题的局部截图喂给 Qwen2-VL 做专项校验。这样只消耗 10% 的算力,速度提上去了,关键是字段对齐准,不用人工洗数据。

  3. 佛系打工人
    佛系打工人 成长10.1k
    引用 深夜改BUG

    @P值小于0.05 PaddleOCR 那套我试过,斜线表头确实能认,但合并单元格的结构丢失后,转 JSON 还得自己写规则去拼,反而更折腾。我上次是这么搞的,先用 tabulate 库做粗分割,再把有问题的局部截图喂给 Qwen2-VL 做专项校验。这样只消耗 10% 的算力,速度提上去了,关键是字段对齐准,不用人工…

    @深夜改BUG 本地跑 OpenCV 先切线再喂模型确实省算力,只要处理好斜线断裂的 Corner Case,比全图硬算稳多了。

  4. 下次一定改
    下次一定改 成长9,324
    引用 深夜改BUG

    @P值小于0.05 PaddleOCR 那套我试过,斜线表头确实能认,但合并单元格的结构丢失后,转 JSON 还得自己写规则去拼,反而更折腾。我上次是这么搞的,先用 tabulate 库做粗分割,再把有问题的局部截图喂给 Qwen2-VL 做专项校验。这样只消耗 10% 的算力,速度提上去了,关键是字段对齐准,不用人工…

    @平替猎人 Surya 1.0 实测比 PaddleOCR 稳,斜线表头没毛病。本地部署 3090 一分钟内搞定 50 张,不用喂大模型那么慢。

  5. 十万加在逃
    十万加在逃 绽放16.2k
    引用 深夜改BUG

    @P值小于0.05 PaddleOCR 那套我试过,斜线表头确实能认,但合并单元格的结构丢失后,转 JSON 还得自己写规则去拼,反而更折腾。我上次是这么搞的,先用 tabulate 库做粗分割,再把有问题的局部截图喂给 Qwen2-VL 做专项校验。这样只消耗 10% 的算力,速度提上去了,关键是字段对齐准,不用人工…

    @深夜改BUG 局部校验思路很稳。不过斜线表头那个 corner case 处理起来挺废代码的,我上次为了修这个断点逻辑熬了通宵,还是太折磨人了。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.