Skyvern:让大模型看懂网页,表单自动化不用再写选择器
网页自动化最烦的地方不是写代码,而是页面一改版,昨天还能跑的脚本今天就报错,接着你又得去翻 DOM 找新的选择器。Skyvern 换了个思路:把「看懂页面」交给大模型和视觉能力,你只描述目标,它自己去定位元素、点按钮、填表单。做爬虫、RPA、内部流程自动化的开发者值得点开看看。核心看点尽量不写选择器:模型同时读取页面结构和截图来定位输入框、按钮,页面做小改动时,流程通常不至于整条报废。一条目标串起整个流程:登录、填表、翻页、下载文件、提取字段可以放进同一个任务,结果能整理成结构化数据。▲ github.com(阿里云通义万相 生成配图,非网页截图)可自托管,有可视化界面:能接多家 LLM 提供方,浏览器里能看到每一步的截图和执行记录,排查问题比翻日志直观。上手提示需要自己准备 LLM 的 API Key,本地部署走 Docker,会拉起 Postgres 等依赖,机器配置别太寒酸。仓库采用 AGPL-3.0,涉及商用或二次分发前请以仓库内 LICENSE 为准。建议先从 README 里最简单的表单任务跑通,再往复杂流程上试。想知道它目前支持哪些模型、最近加了什么能力,直接翻 Skyvern 的 README 与 Releases,那里的更新比二手介绍快得多。

