跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目
最新

Skyvern:让大模型看懂网页,表单自动化不用再写选择器

网页自动化最烦的地方不是写代码,而是页面一改版,昨天还能跑的脚本今天就报错,接着你又得去翻 DOM 找新的选择器。Skyvern 换了个思路:把「看懂页面」交给大模型和视觉能力,你只描述目标,它自己去定位元素、点按钮、填表单。做爬虫、RPA、内部流程自动化的开发者值得点开看看。核心看点尽量不写选择器:模型同时读取页面结构和截图来定位输入框、按钮,页面做小改动时,流程通常不至于整条报废。一条目标串起整个流程:登录、填表、翻页、下载文件、提取字段可以放进同一个任务,结果能整理成结构化数据。▲ github.com(阿里云通义万相 生成配图,非网页截图)可自托管,有可视化界面:能接多家 LLM 提供方,浏览器里能看到每一步的截图和执行记录,排查问题比翻日志直观。上手提示需要自己准备 LLM 的 API Key,本地部署走 Docker,会拉起 Postgres 等依赖,机器配置别太寒酸。仓库采用 AGPL-3.0,涉及商用或二次分发前请以仓库内 LICENSE 为准。建议先从 README 里最简单的表单任务跑通,再往复杂流程上试。想知道它目前支持哪些模型、最近加了什么能力,直接翻 Skyvern 的 README 与 Releases,那里的更新比二手介绍快得多。

GitHub项目
最新

kotaemon:开箱即用的 RAG 文档问答,支持本地模型

手上攒了一堆 PDF、论文和内部资料,想直接对话式提问,又懒得从零写切分、检索、重排那一整条链路?kotaemon 就是冲着这个场景做的:它把 RAG 的脏活累活收进一个能直接跑起来的问答界面,开发者和重度文档用户都能少折腾几轮。核心看点- 问答开箱可用:把文档丢进去就能提问,回答会标出引用来源,能翻回原文对应片段核对。 - 检索不只靠向量:支持全文与向量混合检索,并可挂重排模型,比单纯 embedding 检索的命中更稳一些。 - 模型随便换:云端 API 和本地推理服务(Ollama、vLLM 这类)都能接,还带多用户与信息抽取类的进阶流程。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合想快速验证「文档 + 大模型」产品形态的开发者,以及要求数据不出内网的小团队。跑起来一般需要 Python 环境和 Docker,接云端模型要自备 API Key;纯本地跑的话,显存和机器配置得自己掂量。许可证为 Apache-2.0,商用前建议对照仓库 LICENSE 再确认一遍。想判断它到底能撑到什么程度,翻 README 的安装步骤和界面截图最直观,Discussions 里也有别人踩过的坑。去 kotaemon 仓库看看

GitHub项目
最新

nanochat:把大模型预训练到对话塞进一套代码,值得通读一遍

想弄明白 ChatGPT 这类模型到底是怎么被炼出来的,却总被分布式框架和层层配置劝退?nanochat 把分词、预训练、监督微调、强化学习到推理界面收进同一个仓库,适合愿意读代码、想建立全链路认知的开发者。核心看点- 全流程串成一条线:从原始语料处理到能对话的模型,各阶段用脚本衔接,不用在多个项目之间来回跳。 - 代码量克制:核心逻辑集中,抽象层不厚,读完更容易形成完整心智模型,而不是卡在封装里。 - 自带对话入口:训练完可以直接起一个网页界面聊两句,快速验证效果,闭环很短。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 NVIDIA GPU 与较新的 PyTorch / CUDA 环境,显存和训练时长取决于你选的模型规模,仓库按阶段拆分脚本,建议照 README 的顺序一步步跑。数据集与分词器需要额外下载,涉及权重和第三方数据的授权时,请以仓库 LICENSE 及数据源说明为准;项目采用 MIT 许可。想动手的话,先扫一遍 README 里的运行顺序,再去 Releases 和 Discussions 看别人踩过的坑,能省下不少排错时间。nanochat 仓库主页

GitHub项目

Krita AI Diffusion:不用切窗口,在画布里直接生成和重绘

画图的人大概都有过这种体验:出图在 ComfyUI,修图在 PS,图层和参数倒来倒去,一张图没画完先在软件之间走了一圈。Krita AI Diffusion 想解决的就是这件事——它把生成、重绘、扩图全塞进 Krita 的画布,笔刷和「AI 笔刷」在同一个界面里切换。插画师、漫画作者,以及想给自己的绘图流程接上模型的开发者,都值得点开看看。核心看点- 画布内直接出结果:选区生成、局部重绘、外绘扩展、放大细化都在同一个窗口完成,配合实时绘制的模式,笔还没提起来就能看到反馈。 - 复用 ComfyUI 做后端:采样器、ControlNet、LoRA 都交给 ComfyUI 节点跑,不必再学一套新配置;本地机器或局域网里的另一台显卡机器都能挂上去。 - 对线稿和分镜友好:线稿上色、草图细化、风格迁移这些漫画流程里最费时间的环节,可以按自己的习惯做成固定工作流反复调用。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合有本地显卡、平时就用 Krita 画画的人:需要 Krita 5.2 以上的版本,外加一个能正常工作的 ComfyUI 后端,纯 CPU 跑体验会很差。也可以连远程或云端的 ComfyUI,代价是延迟看网络。插件本体走 GPL 系许可证,但模型权重和各类 LoRA 的授权各不相同,下载前请以各自的 LICENSE 为准。安装步骤、快捷键和最近几个版本的改动,README 和 Releases 里都写得比较细,想动手的话先翻一遍再装:Krita AI Diffusion 仓库

GitHub项目

supervision:给视觉模型输出补上追踪、计数与可视化

跑通检测模型只是开始,真正磨人的是后处理:给每个框分一个稳定 ID、统计过线人数、把结果画成能交付的视频,这些胶水代码写起来一点也不比调模型轻松。supervision 把这些活收进一套轻量工具里,做视频分析、CV 落地的开发者能少写几百行可视化代码。核心看点检测结果后处理一站打包:目标追踪、区域计数、越线统计、轨迹绘制都有现成接口,接上 YOLO、SAM 这类模型即可使用。Annotator 组合式可视化:边框、掩码、标签、热力图都是独立组件,可自由叠加,也能直接写出视频文件,省掉手写 OpenCV 绘图的重复劳动。▲ github.com(阿里云通义万相 生成配图,非网页截图)数据集格式互转:COCO、YOLO、VOC 等标注格式之间的转换与校验不必自己写解析器,做数据清洗时很省事。上手提示pip 安装即可,依赖 NumPy、OpenCV 这类常规库,只做可视化与统计在 CPU 上也能跑;推理本身仍需自备模型权重(例如 Ultralytics 系列),GPU 只有跑模型时才用得上。项目采用 MIT 许可证,商用限制较少,具体条款以仓库 LICENSE 为准。README 里有一批短 GIF 演示和 recipes 示例,扫一眼就知道能不能接进你现有的流程:roboflow/supervision。

GitHub项目

Kokoro:82M 的 TTS 小模型,CPU 上也能跑出自然语音

想在本地做语音合成,第一反应往往是找显卡、下大权重、等推理。Kokoro 走的是另一条路:把 TTS 模型压到很小的体量,普通笔记本的 CPU 就能出声。适合做播客配音、有声书原型、读屏播报,以及想给 Agent「配一张嘴」的开发者。核心看点- 体积与速度:模型只有 80M 级别的参数量,推理几乎不挑硬件,验证想法时不需要先排队等 GPU。 - 多语言与许可:仓库与权重采用 Apache-2.0,中英日等多语种都有现成权重可用,落地前建议以仓库 LICENSE 和模型卡说明为准。 - 上手成本低:pip 装包即可调用,Hugging Face 上有官方权重,社区还贡献了 ONNX 等运行时,方便塞进已有服务。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示典型用法是写几行 Python,把文本丢给 pipeline 直接落成 wav;批量处理长文本时,自己按标点切句并做缓存,效果和速度都会更稳。需要 Python 环境,GPU 不是必须的;合成中文要挑对应的语言权重,别拿英文模型硬套。它不依赖云端 API Key,离线也能跑,对私有化部署比较友好。具体依赖与版本以 README 为准。想先听效果、再看支持的语言列表,可以直接翻 Kokoro 的 README 与 Releases,Issues 里也有不少关于语速、音色和部署的实战讨论。

GitHub项目

opencode:把 AI 编程代理装进终端,会话还能分享给同事

如果你大部分时间待在终端里,大概不想为了用 AI 改代码再切到浏览器。opencode 想做的是把这件事按回键盘前:在项目目录里起一个 TUI,让它读文件、改代码、跑命令,改了什么一眼能看清。常用 CLI 的开发者、想给团队统一一套 AI 编码流程的人,会比较有感。核心看点- 终端原生界面:不依赖 IDE 插件,改动以 diff 形式呈现,接受还是回退都在同一个窗口完成,上下文不用来回复制粘贴。 - 模型可自由替换:通过 provider 配置接入 Anthropic、OpenAI、Google 以及本地推理端点,不想被某一家绑住的话这点很实在。 - 会话可分享:每条会话能生成链接,复盘思路时把链接丢给同事,比截图和口头描述省事;客户端与服务端分离,也方便跑在远端机器上。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 Node.js 环境,装好后配置好模型和 API Key 即可启动;如果走本地模型,把端点指向自己的推理服务也行。仓库采用 MIT 许可,代码本身宽松,但调用的第三方模型服务条款要单独看,以仓库 LICENSE 与各家说明为准。建议第一次在测试分支或临时目录里跑,确认行为符合预期再用于正式项目。想判断合不合手,最快是翻 README 里的安装命令和配置片段,再去 Releases 看最近的改动、Discussions 里看别人踩过的坑。到 GitHub 看 opencode

GitHub项目

Open Notebook:自建 NotebookLM,资料变播客

NotebookLM 好用,代价是资料得放在别人服务器上。open-notebook 把类似体验搬回自己的机器:PDF、网页、音视频链接丢进去,边读边追问,还能生成两个人对谈的播客音频。做课题研究、课程整理、内容选题的人可以直接点开。核心看点多源收料:PDF、网页、Office 文档、视频链接都能进库,自动转写、切分、建索引,省掉手搓文本那一步。边问边溯源:可以限定在某个来源范围内对话,回答带引用,随时翻回原文核对,比纯聊天踏实。一键出播客:把选定资料转成两个 AI 主播的对谈音频,通勤路上听自己攒的料。▲ github.com(阿里云通义万相 生成配图,非网页截图)自托管:Docker 拉起服务,数据留在自己的机器或服务器;模型既接云端接口,也能指向本地推理服务。上手提示需要 Docker 环境,启动后在设置里填入模型 API Key(或改用本地兼容接口)。首次索引大文件会慢一些,建议先拿一两个文档把流程跑通再批量导入。项目采用 MIT 许可证,接入的模型与嵌入服务条款请以各自官方说明为准。想先看看界面长什么样、播客效果如何,去 open-notebook 仓库 翻一遍 README 和 Releases 就够了。

GitHub项目

exo:把闲置的手机和旧电脑,拼成一个能跑大模型的集群

手里有旧笔记本、Mac mini,甚至一台吃灰的安卓机,可单机显存怎么也不够跑大模型——exo 想解决的就是这件事:把同一网络下的多台设备组成一个推理集群,让模型按层切到不同机器上跑。适合家里有闲置硬件、又想本地玩大模型的开发者和折腾党。核心看点- 自动发现组网:同局域网内的设备能互相识别,省掉手写 IP、端口和拓扑的麻烦。 - 异构混搭:Apple Silicon 与 Linux 设备可以放进同一个集群,按各自算力分担不同层。 - 开箱可用的交互:自带类 ChatGPT 的本地界面,后端对接 MLX、llama.cpp 等推理路径,常见开源模型基本能直接加载。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁典型场景是:家里有几台性能一般但联网方便的机器,想凑出更大可跑参数量,而不打算买一张大显存显卡。多机协作对局域网稳定性比较敏感,各设备需要装好 Python 环境和对应后端依赖;模型权重得自己下载,具体授权以仓库 LICENSE 和模型自身的许可条款为准。README 里列了设备支持情况和启动命令,想先看看自己手头的设备能不能凑一桌,直接翻 exo 仓库的说明文档 更快。

GitHub项目

playwright-mcp:让AI用无障碍树操控浏览器,少走截图弯路

想让 Agent 真的会点网页,最常翻车的地方就是截图猜坐标——页面一改版,整段自动化就废。playwright-mcp 换了个路子:把浏览器的无障碍树喂给模型,让它像读文档一样读页面。写后端脚本的、做 Agent 产品的、每天跟后台表单打交道的,都值得点进去看一眼。核心看点不靠像素靠结构:它把 Playwright 的无障碍快照暴露成 MCP 工具,模型看到的是一份带角色和元素引用的清单,点谁、填谁都按引用走,比纯视觉方案稳得多。工具链够日常:导航、点击、填表、上传文件、执行 JS、抓网络请求、截图都收在同一套 MCP 接口里,接上支持 MCP 的客户端就能用。背后是微软:Apache-2.0,更新基本跟着 Playwright 走,Issue 和 PR 都有人接。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示典型用法是让 AI 替你跑重复的网页动作:登录后台导数据、按模板批量填表、做端到端检查。需要 Node.js 环境,用 npx 起服务,然后在 VS Code、Claude Desktop 这类客户端里注册即可;要不要无头、用哪个浏览器频道,都有参数可调。这个服务本身不强制 API Key,真正调模型的是客户端那一侧。第一版建议先在测试站上跑通再引入项目。README 里写了各客户端的配置样例,Releases 也能快速看出最近改了哪块。想先跑通再决定要不要用,直接翻 playwright-mcp 仓库。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.