跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

OmniParser:多模态Agent的UI屏幕解析利器

做 Agent 卡在最尴尬的一步:模型看得见截图,却看不懂按钮和输入框。微软开源的 OmniParser 专门解决这个痛点——把 UI 截图转成带语义的结构化文本,直接喂给 GPT-4V 这类多模态模型,让 Agent 准确点对位置、填对表单。如果你在折腾浏览器自动化、电脑操作 Agent 或数据爬取,这个仓库值得先点开看看。核心看点- 纯视觉 UI 解析:不依赖浏览器 DOM,只靠截图就能识别图标、文本、按钮的坐标和功能描述,适合跨平台操作桌面软件。 - 和现有 Agent 框架好配合:解析结果能作为工具输入,集成到主流编程 Agent 的工作流里,减少“看得到但点不中”的失误。 - 本地部署友好:提供可下载的模型权重和推理脚本,MIT 许可证,改起来没有心理负担。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁正在做 GUI Agent、RPA 或自动化测试的开发者。需要一定的 Python 和模型推理基础,建议用带 GPU 的环境跑推理;官方的模型下载链接放在 README,注意权重许可以仓库说明为准。想追 UI 自动化最新思路的人,可以先看 README 里的示例截图和效果对比,再决定要不要拉代码。OmniParser 仓库主页 把安装步骤和权重下载都写在 README 里了,动手前记得先翻一遍。

GitHub项目

sherpa-onnx:轻量离线语音推理库,一句话搞定ASR与TTS

做语音应用的人都知道,云端接口虽然方便,但延时、隐私和费用都是坑。sherpa-onnx 用 ONNX Runtime 把语音识别、合成、唤醒词和说话人识别全部塞进本地,一行命令甚至能直接在手机上跑,适合不想被云服务绑定的开发者。核心看点- 离线优先:模型完全本地运行,无网络依赖,支持中文、英文等几十种语言,识别和合成质量在轻量模型里相当能打。 - 多平台覆盖:提供 Python/C++/Java 等接口,可部署到 Linux、Windows、macOS、Android、iOS,甚至树莓派上,官方还给了预编译包。 - 部署成本友好:基于 ONNX 量化模型,CPU 上就能实时推理,不需要 GPU,资源占用低,适合边缘设备。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁做移动端语音助手、实时字幕、离线翻译或嵌入式语音交互的开发者。Python 环境配好即可,按 README 安装依赖后就能跑 demo;想要跳过编译直接用预编译包也行。注意不同模型有各自的授权条款,商用前请查阅仓库 LICENSE 和模型页说明。如果你对“端上跑通全套语音能力”这件事感兴趣,不妨去 README 看看支持哪些模型和调用方式,顺手在 sherpa-onnx 仓库页 里翻一下最新 release 和示例代码。

GitHub项目

Parler-TTS:开源语音合成,几行代码生成自然语音

做语音总被困在在线 API 的限速和账单里?Parler-TTS 让多说话人语音合成真正跑在本地,Hugging Face 出品,Apache-2.0 许可证,对开发者、内容创作者和语音研究者都很友好,不需要订阅任何云服务。核心看点- 低成本复刻音色:用 5 秒左右的音频样本描述说话人,即可生成接近目标音色的语音,支持继续微调,打造专属声线。 - 可控制风格与语速:通过自然语言描述控制情感、停顿、语速等细节,比普通 TTS 硬编码参数更加直观,适合做有声书、视频配音。 - 训练推理代码一体:仓库内置数据预处理、训练、推理全流程,社区已有大量微调教程,拿来改造并不难。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示建议准备一张 16GB 显存的 GPU,Python 3.10 以上即可运行。不需要任何 API Key,模型权重全部开放在 Hugging Face Hub,首次运行会自动下载。注意 README 中对音频采样率、时长等格式要求,先跑示例再换自己的数据。对语音克隆或可控 TTS 感兴趣的话,去仓库看示例音频和微调脚本,很快能体验复刻加改写的完整流程。传送门:Parler-TTS GitHub 仓库

GitHub项目

LeRobot:让真实机器人学会操作的开源入门套件

想试机器人学习却总被仿真环境劝退?LeRobot 把模仿学习、强化学习打包成可直接跑的 Python 框架,支持真实机械臂,也支持仿真后端。它由 Hugging Face 维护,代码结构清晰,适合想从零接触 Robot Learning 的开发者或研究者。核心看点- 低门槛上手:提供统一 API 和预训练 checkpoint,从数据采集、模型训练到部署开箱即用,不要求自己搭仿真环境。 - 真实硬件支持:针对常见桌面机械臂提供现成配置,官方整理过硬件清单,社区也能共享数据集,生态比想象中热闹。 - 与 Hugging Face 生态打通:数据集和模型都能直接走 Hub,方便复现和协作,还带 Gradio 演示界面,调参更直观。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁对机器人操控刚起步的开发者和 AI 学生最合适。本地跑通需要一台带 CUDA 的 GPU,不过纯推理用小模型也可以 CPU 勉强凑合;不需要额外 API Key,所有资源都是开源开放的。Apache-2.0 许可,商用前建议自己再看一遍 LICENSE。想了解具体支持哪些机器人型号、怎么采数据,直接看 README 的快速开始部分,顺便去 Issues 里瞄一眼社区最近的踩坑记录。仓库入口:huggingface/lerobot

GitHub项目

OlmoOCR:高保真PDF转文本,RAG解析不头疼

很多搭 RAG 管线的人,最后都会卡在 PDF 解析上:扫描件、双栏、错位表格,喂给模型全是乱码。OlmoOCR 是艾伦 AI 研究所开源的高保真 PDF 转文本/HTML 工具,专治这种「文档预处理」难题,适合在搭知识库、做文档解析的开发者或研究者。核心看点它把扫描 PDF 直接变成可用的干净文本,能读懂复杂版面,表格、双栏、多级标题大体能按原顺序输出,而不是简单切块。更重要的是,不只给纯文本,还能转出 HTML,把粗体、斜体、页码这类结构信息保留下来,下游 RAG 或者网页渲染用起来更舒服。项目以 Apache-2.0 开源,推理流程可自托管,模型权重和代码都在,只要有 GPU 就能把数据留在自己手里。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合正在做 RAG、文档问答、批量档案数字化的工程师和研究者。它默认会下载多模态模型权重,建议至少准备一张 NVIDIA GPU,具体显存、依赖版本以仓库 README 为准;不需要任何付费 API Key,自己部署就能跑。想判断它能不能处理你手头那堆扫描件,直接去 OlmoOCR 仓库 看 README 里的效果示例和命令行样例,或者带着真实文档去 Issues 里问维护者。

GitHub项目

DeepSpeed 不止省显存:训练推理一把抓的开源提速库

如果你和我一样,在本地调大模型时总被 OOM 劝退,DeepSpeed 值得花十分钟看一下。这是微软开源的深度学习优化库,专治大模型训练和推理时的显存焦虑,Apache-2.0 协议,社区相当活跃,不是躺在仓库里吃灰的项目。核心看点- ZeRO 系列优化:把模型参数、梯度、优化器状态切分到多卡或多设备上,配合 Offload 还能把部分数据放到 CPU/SSD,让原来塞不进的模型跑起来。对单卡玩家和集群用户都有实际帮助。- 推理能力同样能打:支持 DeepSpeed-Inference,包含内核融合、稀疏算子、KV Cache 等优化,同一套工具链从训练过渡到部署,不用来回切换框架。▲ github.com(阿里云通义万相 生成配图,非网页截图)- 上手不算陡:继承自 PyTorch 的写法,对已有代码改造量小。常用功能都有文档和示例,遇到问题在 GitHub Issues 里找答案很方便。适合谁主要面向用 PyTorch 做大模型训练、微调或推理的工程师与研究者。如果手里只有一两张消费级显卡,又想跑超出显存容量的模型,ZeRO-Offload 值得试试。需要熟悉 Python 和 PyTorch 基础,按 README 安装依赖即可,不需要额外 API Key。想了解具体的 ZeRO 阶段、Offload 策略和推理加速配置,直接去仓库的 README 和官方文档翻一翻。动手之前记得先确认你的 PyTorch 和 CUDA 环境匹配,再对照示例跑通一个模型,感受会直观很多:进入 DeepSpeed 仓库

GitHub项目

tinygrad:用很少的代码读懂深度学习与大模型推理

绝大多数人用深度学习框架就是调 API,想亲眼看清张量、自动求导、反向传播到底怎么运作,往往被 PyTorch 那几十万行代码劝退。tinygrad 把核心逻辑压缩得很紧凑,同时又保留了可用的训练和推理能力,适合想拆开黑盒的工程师和研究爱好者。核心看点- 极简内核:用相对很少的代码实现张量、自动求导和常见优化器,阅读它比啃 PyTorch 源码轻松得多。 - 多后端支持:同一套模型可跑在 CPU、CUDA、OpenCL、WebGPU 上,换设备时不用改写业务代码。 - 能训也能推理:既能训练小型模型,也能加载类似 LLaMA 的权重做推理,用来理解大模型内部机制正合适。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想真正理解框架底层原理的开发者,或需要在不同设备上做轻量推理的爱好者。项目基于 Python,依赖少,纯 CPU 环境就能跑;GPU 版需要对应的驱动或 CUDA 环境,不需要 API Key。如果你早已厌倦把框架当黑盒用,点进 README 从代码目录开始走读,会有种豁然开朗的感觉。打开 tinygrad 仓库 看看它是如何在紧凑代码里撑起一个完整的深度学习栈。

GitHub项目

Qwen-Agent:让通义千问学会调用工具的开源 Agent 框架

写 RAG 或多步推理时,最烦的就是把大模型和工具调用粘在一起自己造轮子。Qwen-Agent 是阿里开源的一套轻量 Agent 框架,专门围绕 Qwen 系列模型设计,装完就能让模型自己决定调什么函数、传什么参数,适合想快速把通义千问接进业务流的开发者。核心看点- 原生函数调用:内置与 Qwen 模型对齐的 tool calling 机制,定义好 JSON Schema 就能让模型自主选择工具,少走 prompt 调优弯路。 - 多 Agent 协同:支持拆分子任务给不同 Agent,再汇总结果,做简单编排不用再引入重型框架。 - 开箱即用:提供命令行交互和 API 两种模式,本地跑通只需 Python 环境加一个模型服务,对研究者和原型验证都很友好。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想用通义千问系列模型落地 Agent 场景的开发者,比如做代码助手、信息查询工具或流程自动化。默认对接 DashScope API,也可以切换到本地部署的 Qwen 模型;需要准备 API Key,但仓库里给了完整的示例和文档,照着改就行。如果你最近正好在对比不同 Agent 框架,值得点开 Qwen-Agent 的 README 看看它的设计取舍,尤其适合搭过 LangGraph 但嫌重的人。

GitHub项目

Perplexica:本地自托管 AI 搜索,隐私与体验兼得

想要 Perplexity 那样的智能搜索体验,却不想把每次查询都交给第三方服务?Perplexica 是一个能完整跑在自己服务器上的 AI 搜索引擎,从索引到生成答案都由你掌控,特别适合对数据隐私敏感的开发者或研究者。核心看点- 本地推理优先:可接入 Ollama 或 llama.cpp 等本地模型,也支持 OpenAI、Claude 这类远端 API,切换不锁死。 - 多搜索模式:内置日常对话、学术检索、视频查找等多种模式,返回结果时附带引用来源,比单纯调用大模型更贴近真实搜索场景。 - 部署友好:提供 Docker 镜像,一条命令就能启动;界面风格接近主流 AI 搜索产品,上手成本低。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想给团队做一个私有化知识入口的工程师,或者不想让查询记录离开本机的个人用户。如果你已有一台能跑 7B 级别模型的机器,配合 Ollama 即可全本地运行;想快速尝鲜,也只需配置一个 OpenAI API Key 就能体验完整功能。项目基于 MIT 许可证,可放心二次改造。想对比不同模型在搜索场景下的表现,建议直接去 Perplexica 仓库 看 README 里的部署指引,顺便翻翻 Issues 里大家分享的配置经验。

GitHub项目

llm.c:几百KB C代码跑GPT-2,Karpathy手把手拆解训练

想搞懂大模型训练时那些反向传播、梯度下降到底在干什么?Karpathy 的 llm.c 把 GPT-2 的推理和训练压缩进一个纯 C 文件,不装 PyTorch 也能跑起来。适合想从框架里跳出来、亲眼看看 Transformer 每一步计算的开发者,也适合研究生或爱好者拿来做实验底稿。核心看点- 纯 C 实现:没有 Python 依赖,CPU 上即可编译运行;GPU 版用 CUDA 写出可对比的 kernel,让你看清 PyTorch 里那些『魔法』本质。 - 完整训练流程:不是玩具,它包含数据加载、前向、反向、AdamW 优化器,真正训练出可用的小规模 GPT 模型。 - 自带参考实现:仓库同时提供 PyTorch 参考代码,方便对照 C 版本验证数值和梯度,理解每层数学推导。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示适合机器不太够用的同学:单张消费级显卡甚至纯 CPU 都能跑通小配置,只需装好 C 编译器和 CMake;不必申请任何 API Key。想立刻动手,先跑 ./run.sh 或按 README 指引编译,然后观察 loss 下降。如果你想复现更大的 GPT-2 规模,建议使用带 CUDA 的 NVIDIA 显卡,显存越大越省心。想自己修改注意力机制或换数据集,仓库结构很短,读代码比查文档快。具体依赖、复现脚本和已知问题都在 llm.c 的 README 里,最近提交仍在更新,值得点进来看一眼。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.