跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 6 回复
  • 822 浏览

求个能把PDF合同拆成Excel条款明细的脚本

参与讨论

最近审合同,几十页的PDF里夹着几十条补充条款,用脑子对照着找太容易漏。刚试了几个在线转换,要么排版全乱,要么把备注文字混进主表格里。有没有那种能准确识别“第一条”、“第二款”这类层级,直接吐出规整Excel的现成工具?要免费的,公司网管不让随便装软件。

之前用过Python库解析,但对扫描件效果太差。要是能直接丢文件进去出结果的SaaS更好,求推荐,急用。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

6s 条评论

  1. 周末补作业
    周末补作业 成长10.5k

    PDF24 那个网页版对非扫描版 PDF 的表格还原确实比 Smallpdf 稳,别去折腾 OCR 了。注意看下合同里有没有合并单元格,那个正则清洗起来头大。

  2. 路过点个赞
    路过点个赞 绽放13.2k

    @强迫症晚期 别折腾那些花哨的在线工具了,扫描件层级识别本来就是伪命题。如果公司允许,直接用 Adobe Acrobat Pro 的「导出 PDF」功能,选 Excel 格式,然后在高级选项里勾选「保留页面格式」,它能自动识别表格线,比单纯 OCR 靠谱得多。

  3. 接口又500
    接口又500 成长10.1k

    在线工具对扫描件层级识别基本没救,别折腾了。@强迫症晚期 你们这PDF是电子的还是扫描的?电子的话用 pdftotext -layout 配合简单的正则清洗就能出结构化数据,不费事。

  4. BurnRate老王
    BurnRate老王 成长11.1k

    @强迫症晚期 免费且不用装软件的方案,强推Adobe Acrobat Online的PDF转Excel功能,它在云端处理合同条款的层级保留得不错。如果它对扫描件支持不行,试试Smallpdf,虽然每天有限制但够用,先把PDF转图片OCR再导表,比硬啃Python库省事多了。

  5. 平替猎人
    平替猎人 成长10.5k
    引用 BurnRate老王

    Acrobat 在线版对扫描件层级识别经常抽风,别指望它。iLovePDF 的 OCR 选项相对稳点,免费额度够撕几个合同,记得选“带格式转换”。

  6. 一句封神
    一句封神 绽放16.2k
    引用 平替猎人

    Acrobat 在线版对扫描件层级识别经常抽风,别指望它。iLovePDF 的 OCR 选项相对稳点,免费额度够撕几个合同,记得选“带格…

    emmm 这种带复杂层级的合同,普通OCR很容易把条款序号打散,建议试试 PDF24 Tools 那个免费网页版,它对表格结构的还原比 Smallpdf 稳一点。要是扫描件实在难搞,先用 Adobe Scan 转成可编辑 PDF 再导 Excel,虽然多一步但能保住层级。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.