跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

TEN-Agent:把实时语音+视觉 Agent 装进自己的服务

搭一个能听、能看、能对话的 AI Agent,最烦人的往往不是模型本身,而是把音频流、STT、LLM、TTS 和摄像头输入手动串起来。TEN-Agent 把这套链路做成了可编排的实时多模态 Agent 运行时,适合想快速落地语音助手、智能终端或远程协作场景的开发者。核心看点- 实时多模态对话:支持语音、视频和文本输入同时进 Agent,自带打断与状态控制,不是简单的一问一答。 - 可视化 Agent Graph:用节点方式编排 STT、LLM、TTS 和业务逻辑,改一个分支不用推倒重写,调试时能直接看服务端消息流。 - 模块化后端与干净许可:ASR、LLM、TTS 都可替换接入,仓库以 Apache-2.0 开源,团队拿来改造商用心里比较有底。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示直接先看仓库里的 Playground 示例,按 README 配环境变量即可跑通一个基本对话 Agent。想体验完整语音链路,需要准备 ASR/TTS 或 RTC 厂商的 Key;如果只验证推理逻辑,先开文本模式更省事。文档和 issue 讨论都比较活跃,跟着官方示例比从零看协议更舒服。建议别只看 Readme 第一屏,花几分钟翻一遍 agents 目录和 Graph 示例,很多细节比教程讲得清楚:TEN-Agent 仓库

GitHub项目

LeRobot:让真实机器人学会操作的开源入门套件

想试机器人学习却总被仿真环境劝退?LeRobot 把模仿学习、强化学习打包成可直接跑的 Python 框架,支持真实机械臂,也支持仿真后端。它由 Hugging Face 维护,代码结构清晰,适合想从零接触 Robot Learning 的开发者或研究者。核心看点- 低门槛上手:提供统一 API 和预训练 checkpoint,从数据采集、模型训练到部署开箱即用,不要求自己搭仿真环境。 - 真实硬件支持:针对常见桌面机械臂提供现成配置,官方整理过硬件清单,社区也能共享数据集,生态比想象中热闹。 - 与 Hugging Face 生态打通:数据集和模型都能直接走 Hub,方便复现和协作,还带 Gradio 演示界面,调参更直观。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁对机器人操控刚起步的开发者和 AI 学生最合适。本地跑通需要一台带 CUDA 的 GPU,不过纯推理用小模型也可以 CPU 勉强凑合;不需要额外 API Key,所有资源都是开源开放的。Apache-2.0 许可,商用前建议自己再看一遍 LICENSE。想了解具体支持哪些机器人型号、怎么采数据,直接看 README 的快速开始部分,顺便去 Issues 里瞄一眼社区最近的踩坑记录。仓库入口:huggingface/lerobot

GitHub项目

sherpa-onnx:轻量离线语音推理库,一句话搞定ASR与TTS

做语音应用的人都知道,云端接口虽然方便,但延时、隐私和费用都是坑。sherpa-onnx 用 ONNX Runtime 把语音识别、合成、唤醒词和说话人识别全部塞进本地,一行命令甚至能直接在手机上跑,适合不想被云服务绑定的开发者。核心看点- 离线优先:模型完全本地运行,无网络依赖,支持中文、英文等几十种语言,识别和合成质量在轻量模型里相当能打。 - 多平台覆盖:提供 Python/C++/Java 等接口,可部署到 Linux、Windows、macOS、Android、iOS,甚至树莓派上,官方还给了预编译包。 - 部署成本友好:基于 ONNX 量化模型,CPU 上就能实时推理,不需要 GPU,资源占用低,适合边缘设备。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁做移动端语音助手、实时字幕、离线翻译或嵌入式语音交互的开发者。Python 环境配好即可,按 README 安装依赖后就能跑 demo;想要跳过编译直接用预编译包也行。注意不同模型有各自的授权条款,商用前请查阅仓库 LICENSE 和模型页说明。如果你对“端上跑通全套语音能力”这件事感兴趣,不妨去 README 看看支持哪些模型和调用方式,顺手在 sherpa-onnx 仓库页 里翻一下最新 release 和示例代码。

GitHub项目

crawl4ai:把网页洗成 LLM 爱吃的 Markdown,RAG 不用手搓数据

做 RAG 最烦的往往不是模型,而是喂进去的网页又脏又碎:导航、广告、JS 渲染的内容混在一起,切完 chunk 全是噪声。crawl4ai 就是冲这件事来的——一个专门给 LLM 备料的开源爬虫,输出直接是干净 Markdown 和结构化 JSON。开发者、自建知识库的人、跑 Agent 的人都能少写一堆清洗代码。核心看点- 为 LLM 优化的输出:默认把页面转成 Markdown,保留标题层级、表格、代码块,也支持用 CSS/XPath 提取结构化字段,预处理量能省一大截。 - 不用从零手写爬虫:异步并发抓取,可接 Playwright 渲染 JS 页面,带会话、代理、去重和整站爬取模式。 - 能当数据摄取层:对上可以接主流 LLM 做内容过滤与抽取,对下能塞进 Agent 或 RAG 流程里补实时网页上下文。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁典型场景是自建知识库、资讯或竞品监控、给 Agent 补实时网页信息。依赖 Python 环境,需要浏览器渲染时用 crawl4ai-setup 装 Playwright;部分抽取能力要自备 API Key,也可以换本地模型。项目采用 Apache-2.0 许可,商用前建议以仓库 LICENSE 为准。想先试水,就跑 README 里那段最小示例抓一个页面,再去翻它的 Markdown 生成器和提取策略说明。去 crawl4ai 仓库翻一眼

GitHub项目

Codex CLI:让 AI 直接在终端里改代码、跑测试

有些 AI 编程工具只敢给你生成补丁,Codex CLI 则直接接管终端里的脏活:你提任务,它自己查报错、改文件、跑测试,遇到要执行命令时会先征求同意。适合已经厌倦复制粘贴报错、想试试 Agent 式编程的开发者,尤其适合日常在本地仓库高频提交的工程向玩家。核心看点- 真正在项目里落地干活:不是对着聊天框生成一段代码就完事,而是本地读取文件、做修改、运行测试,再根据失败信息继续修,直到任务真正收敛。 - 把安全边界摆上台面:默认命令执行前要你审批,文件改动附带清晰 diff,想放权或收紧都能按需设置,不会让 AI 在仓库里横冲直撞。 - 接入路径比较自由:既能登录 ChatGPT 账号直接使用,也能配置自己的 API Key,还支持指向兼容 OpenAI 接口的自定义模型服务。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁最值的是已有 ChatGPT 订阅或 API 额度、又不想为 AI 编程换 IDE 的开发者。安装并不复杂,npm 或 Homebrew 都能搞定。仓库用 Apache-2.0 开源,README 里把鉴权、代理和审批模式写得很清楚;自带 Key 跑的话,顺手留意 token 消耗。想挑一个真实项目任务试试它到底能帮多少忙,直接照着 Quick Start 拉个最小复现即可——点开 Codex CLI 仓库看用法,剩下的交给它。

GitHub项目

MoneyPrinterTurbo:给个主题自动出短视频,值得一开

随手刷到一条口播视频,觉得镜头语言一般但流量不低,自己也想批量试做?MoneyPrinterTurbo 的思路是把你丢进去的标题,自动变成脚本、配音、字幕和成片。适合想用 AI 做短视频内容又不想写代码的自媒体爱好者,也适合想观察整套生成管线的开发者。核心看点- 从标题到成片串成流水线:不用手动一段段剪,填个主题让大模型撰稿,再转成语音并合成视频,常规口播内容能省下不少机械操作。 - 模型和语音环节可替换:后端脚本生成、TTS 那两段都会留配置入口,想接在线 API 还是本地推理都看自己需求,README 里也有对应说明。 - 既有界面也有 API 模式:闲时点鼠标操作,忙时把接口挂进自动化流程,二次开发不用绕太远。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示首次运行前,确认系统里装好了 Python 环境和 FFmpeg,再去看仓库里列出的配置项,比如语音服务、素材来源或大模型接口。它不一定非要 GPU 才能跑,但若你想在素材上有更多原创性,往往需要另外准备可用的视觉生成服务或素材 API Key。导入模型权重前也务必留意仓库 LICENSE,不要默认可以商用。这套工具强在“把短片生产流程串起来”,并不代表出来的内容可以直接发布。花点时间改脚本、挑素材,再用它做批量化输出,反而更稳。想判断要不要纳入自己的工具箱,直接去 MoneyPrinterTurbo 的 README 看安装方式与更新记录。

GitHub项目

OmniParser:多模态Agent的UI屏幕解析利器

做 Agent 卡在最尴尬的一步:模型看得见截图,却看不懂按钮和输入框。微软开源的 OmniParser 专门解决这个痛点——把 UI 截图转成带语义的结构化文本,直接喂给 GPT-4V 这类多模态模型,让 Agent 准确点对位置、填对表单。如果你在折腾浏览器自动化、电脑操作 Agent 或数据爬取,这个仓库值得先点开看看。核心看点- 纯视觉 UI 解析:不依赖浏览器 DOM,只靠截图就能识别图标、文本、按钮的坐标和功能描述,适合跨平台操作桌面软件。 - 和现有 Agent 框架好配合:解析结果能作为工具输入,集成到主流编程 Agent 的工作流里,减少“看得到但点不中”的失误。 - 本地部署友好:提供可下载的模型权重和推理脚本,MIT 许可证,改起来没有心理负担。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁正在做 GUI Agent、RPA 或自动化测试的开发者。需要一定的 Python 和模型推理基础,建议用带 GPU 的环境跑推理;官方的模型下载链接放在 README,注意权重许可以仓库说明为准。想追 UI 自动化最新思路的人,可以先看 README 里的示例截图和效果对比,再决定要不要拉代码。OmniParser 仓库主页 把安装步骤和权重下载都写在 README 里了,动手前记得先翻一遍。

GitHub项目

Vanna:用大白话直查数据库,把 Text-to-SQL 做进你的应用

被业务拉着要报表又要反复改口径的开发者,很多时间其实消耗在写联表 SQL 上。Vanna 把“自然语言→SQL→结果回显”的完整链路收拢成一套 Python 框架,只需要准备你的数据库 schema 和少量样例,就能生成可解释的查询。它长期保持活跃提交,MIT 许可,想给团队搭一个内部查数助手的人会很对胃口。核心看点- 训练即 RAG,不碰微调:Vanna 先把 DDL、文档和几个示例问题做向量化,查询时找到最相关的表结构再交给 LLM 生成 SQL。换模型成本低,基础原理也好懂。 - 一接口连多种数据库:SQLite、PostgreSQL、Snowflake、BigQuery 等都有适配器,代码里切换数据库不用推翻重写,适合数仓环境不只一套的团队。 - 带展示界面也带 API:内置了一个轻量 Web 聊天页面,同时可以只调用 Vanna 的 Python 函数集成进现有程序;回答会附上 SQL 原文,方便核对与排查。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合被取数需求反复打扰的数据工程师,以及想快速落地一个可用的“企业查数机器人”的开发者。Vanna 本身不绑死某家模型,你只需要任一 OpenAI 兼容或 OpenRouter 的 API Key,想完全本地跑也可以接 Ollama 的兼容端点。安装走 pip 就好,但跑在敏感库上时最好给只读账号权限。整体思路比直接拿着大模型硬写要可控,多表关联场景尤其值得琢磨。想看看它如何设计训练集和连接器,直接去 Vanna 的 GitHub 主页 翻 README 和示例,比自己从零踩坑省时间。

GitHub项目

LiveKit Agents 用 Python 快速搭建会说会听的实时 AI 助手

想做一个像真人一样能即时对话的语音助手,最烦的不是模型,而是要自己拼 ASR、LLM、TTS 和 WebRTC 那一堆连接线。LiveKit Agents 把这条链路整理成了 Python 框架,让开发者可以专心写业务逻辑,而不是反复折腾底层传输。核心看点- 模块化流水线:STT、LLM、TTS 作为插件解耦,按需更换供应商,不用绑定某个模型全家桶。 - 实时交互控制:支持语音打断、会话状态回调,能处理人机交错的自然对话节奏,而不是一问一答式死板循环。 - 与会话基础设施结合:基于 LiveKit WebRTC 网络,用少量代码就获得低延迟的音频流传输,前端 SDK 对接成熟。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁面向想快速做语音 Agent 原型或产品化的开发者。需要准备 Python 环境,最好有基本的实时流式概念;自带服务需要 LiveKit Cloud Key,也可以自己搭建服务端。具体模型接入、Key 配置都在 README 里有示例。建议打开仓库看看 examples 文件夹,几行代码就能跑起一个语音助手。全部以 Apache-2.0 开源,动手前先确认依赖的模型权重许可。去 LiveKit Agents 仓库主页 慢慢翻。

GitHub项目

DeepSpeed 不止省显存:训练推理一把抓的开源提速库

如果你和我一样,在本地调大模型时总被 OOM 劝退,DeepSpeed 值得花十分钟看一下。这是微软开源的深度学习优化库,专治大模型训练和推理时的显存焦虑,Apache-2.0 协议,社区相当活跃,不是躺在仓库里吃灰的项目。核心看点- ZeRO 系列优化:把模型参数、梯度、优化器状态切分到多卡或多设备上,配合 Offload 还能把部分数据放到 CPU/SSD,让原来塞不进的模型跑起来。对单卡玩家和集群用户都有实际帮助。- 推理能力同样能打:支持 DeepSpeed-Inference,包含内核融合、稀疏算子、KV Cache 等优化,同一套工具链从训练过渡到部署,不用来回切换框架。▲ github.com(阿里云通义万相 生成配图,非网页截图)- 上手不算陡:继承自 PyTorch 的写法,对已有代码改造量小。常用功能都有文档和示例,遇到问题在 GitHub Issues 里找答案很方便。适合谁主要面向用 PyTorch 做大模型训练、微调或推理的工程师与研究者。如果手里只有一两张消费级显卡,又想跑超出显存容量的模型,ZeRO-Offload 值得试试。需要熟悉 Python 和 PyTorch 基础,按 README 安装依赖即可,不需要额外 API Key。想了解具体的 ZeRO 阶段、Offload 策略和推理加速配置,直接去仓库的 README 和官方文档翻一翻。动手之前记得先确认你的 PyTorch 和 CUDA 环境匹配,再对照示例跑通一个模型,感受会直观很多:进入 DeepSpeed 仓库

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.