跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 7 回复
  • 904 浏览

求个能批量处理合同比对的AI

参与讨论

刚刷到抖音“一人说一个信息差”评论区,有人提用AI审合同省大钱。正好手头有点活儿:每周几十份供应商合同,要逐条比对版本差异、标红风险条款。

试过几个OCR工具,识别率还行但对比逻辑弱。有没有能本地跑的开源方案或便宜API的?最好支持PDF直传,不用挨个导出。老哥们有实战过的没?

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

7s 条评论

  1. 炼丹炸炉了
    炼丹炸炉了 萌芽1,865

    @深夜改BUG 本地跑的话,开源的 docling 确实能 PDF 直出差异对比,我拿几十页合同试过,标红还行。但要逐条比对风险条款,它只标文本差异,不识别逻辑风险,得自己再加规则。另外试试 difftastic,比 difflib 直观。

  2. 运维祭天
    运维祭天 绽放14.1k
    引用 炼丹炸炉了

    @深夜改BUG 本地跑的话,开源的 docling 确实能 PDF 直出差异对比,我拿几十页合同试过,标红还行。但要逐条比对风险条款…

    @炼丹炸炉了 docling 确实能 PDF 直出差异,但风险条款得自己写规则。我搭了个 pipeline:docling 输出差异段,再用 difftastic 标红,最后用 LLM 扫一遍风险关键词(比如“赔偿上限”“免责”),准确率还行。便宜 API 的话,Azure 那个按页计费,文档结构保留得比 OCR 好。

  3. 围观不发言
    围观不发言 萌芽2,308
    引用 运维祭天

    @运维祭天 那个pipeline具体用的什么LLM扫风险关键词?我试过用本地模型比如Qwen2.5-7B,但合同术语多的时候准确率掉得厉害。另外docling对扫描PDF确实拉胯,得先上OCR。

  4. 火锅涮代码
    火锅涮代码 萌芽791
    引用 围观不发言

    @围观不发言 试过用Qwen2.5-7B扫风险关键词,确实合同术语一多就崩。换成gpt-4o-mini API便宜点,或者本地用GLM-4-9B微调合同术语,准确率能上来。docling对扫描PDF拉胯的话,先上PaddleOCR转文字再塞进去。

  5. 五百一天Ken
    五百一天Ken 成长11.9k
    引用 炼丹炸炉了

    @深夜改BUG 本地跑的话,开源的 docling 确实能 PDF 直出差异对比,我拿几十页合同试过,标红还行。但要逐条比对风险条款…

    @炼丹炸炉了 本地跑的话,docling + difftastic + LLM 扫风险关键词确实稳。但注意docling对扫描版PDF识别差点,得先转文字。另外Azure那个API 0.5刀一页,量大的话还是本地香。

  6. 暴躁老哥
    暴躁老哥 新芽361

    docling试过没,直接PDF进,能标红差异,开源。@深夜改BUG

  7. 下次一定改
    下次一定改 成长9,324

    @深夜改BUG 这玩意diff逻辑弱的话试试Diffbot或者直接上python difflib+pdfplumber,本地跑零成本。便宜API可以看Azure Document Intelligence,按页计费,PDF直传没问题。有人用过没

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.