跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

BitNet:把大模型压到 1-bit,CPU 上也能跑推理

想在本地跑大模型,先被显卡和内存劝退的人不少。microsoft/BitNet 走的是另一条路:把权重压到极低位宽,让不少推理负载直接落在 CPU 上。如果你做端侧部署、想省显存,或者单纯好奇低比特推理到底能跑成什么样,这个仓库值得点开看看。核心看点- 1-bit 权重推理:仓库里的 bitnet.cpp 面向三值/低比特量化模型,重点就是把推理从 GPU 往 CPU 上挪,显存压力小很多。 - 工具链相对完整:不只是论文配套代码,还包含量化与转换相关的脚本、构建说明和官方权重入口,自己拼流程的活儿少一些。 - MIT 许可,社区在动:issue 与 PR 里能看到持续的构建、性能与平台适配讨论,不是躺着不更新的仓库。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 Python 加 C++ 编译环境,Linux / Windows / macOS 都有对应构建说明;CPU 推理对内存仍有要求,模型权重得自己从 Hugging Face 下载。各权重页面的许可条款不完全相同,商用前请以仓库 LICENSE 与模型页面说明为准。想快速验证,先照着 README 的 quick start 走一遍最省事。真正想知道低比特推理跑起来是什么手感,建议直接去翻 README 里的构建步骤和性能说明,再顺手看下 Releases 有没有新的量化脚本。先去读一遍 BitNet 的 README

GitHub项目

Mochi 1 开源视频生成:一句提示词生成流畅电影级动态

如果你试过 Sora 但没资格内测,或者被闭源模型的价格劝退,Genmo 开源的 Mochi 1 可能是目前最值得你本地跑一把的视频生成模型。它用 Apache-2.0 许可发布,不需要排队,直接下载权重就能在单卡 A100 上生成 5 秒左右的连贯视频,效果直逼商业方案。核心看点端到端视频扩散:基于 Asymmetric VAE 和 Transformer 架构,直接在 RGB 像素空间生成视频,省去了单独动捕或帧插值步骤。支持 8 秒 540p 的原始分辨率,运动幅度和物体一致性比前代 CogVideoX 更自然。开源权重 + 商业友好许可证:模型权重和推理代码一并放出,MIT 许可证改写和商用限制极少,无论是做独立创作者工具原型还是集成到自家产品,法律风险都很低。▲ github.com(阿里云通义万相 生成配图,非网页截图)社区灵活扩展:官方提供了 Gradio 网页界面和 CLI 两种启动方式。已有开发者尝试 LoRA 微调来控制特定风格,Issues 里也有人在讨论低显存优化(如 FP8 量化)。上手提示建议使用 Linux + Python 3.10,单张 A100(40GB) 即可跑 5 秒视频;如果只有 24GB 显存(如 3090),可以降低帧数量或用官方的蒸馏版模型。权重自动从 HuggingFace 下载,约 10GB。仓库的 README 里贴了现成的 pip install -r requirements.txt 和启动命令,十分钟就能看到第一个 demo。想立刻体验文字到视频的创作快感,直接戳 genmo/mochi 跑起官方脚本,Issues 区还有不少社区调参经验等你挖。

GitHub项目

Letta:给 Agent 装上能自我更新的长期记忆

如果手头的 Agent 总在多轮对话后“失忆”,Letta 值得你点开源码看一眼。它是 MemGPT 的延续,把研究里的“自我编辑记忆”变成可自托管的 Agent 框架,非常适合正在做复杂助手、知识型 Bot 或长期任务的开发者。核心看点- 记忆即代码:上下文按 memory block 组织,Agent 可以通过工具调用自主写入、更新和清理记忆,而不是把所有历史都硬塞进 prompt。 - 开箱即用的运行时:带 REST API 和 Python SDK,配合官方 Server 就能本地跑起来,既接 OpenAI/Anthropic 这类云模型,也能对接本地推理服务。 - Apache-2.0 许可:可以放心自托管和二次开发,仓库近期提交与 Issues/PR 讨论都还算活跃,不是摆样子的空壳。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合被 context window 限制折磨的开发者和想研究 Agent 长期记忆机制的研究者。运行 Letta 需要准备好 Python 环境,服务端可以按 README 说明容器化部署;调用云模型要 API Key,用本地模型则参照你自己部署的推理服务即可。想理解 memory block 到底怎么工作,直接按 README 快速跑一个带记忆的 Agent;想聊架构取舍和后续方向,可以翻 Discussions。先从这个入口进:Letta 仓库

GitHub项目

LeRobot:让真实机器人学会操作的开源入门套件

想试机器人学习却总被仿真环境劝退?LeRobot 把模仿学习、强化学习打包成可直接跑的 Python 框架,支持真实机械臂,也支持仿真后端。它由 Hugging Face 维护,代码结构清晰,适合想从零接触 Robot Learning 的开发者或研究者。核心看点- 低门槛上手:提供统一 API 和预训练 checkpoint,从数据采集、模型训练到部署开箱即用,不要求自己搭仿真环境。 - 真实硬件支持:针对常见桌面机械臂提供现成配置,官方整理过硬件清单,社区也能共享数据集,生态比想象中热闹。 - 与 Hugging Face 生态打通:数据集和模型都能直接走 Hub,方便复现和协作,还带 Gradio 演示界面,调参更直观。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁对机器人操控刚起步的开发者和 AI 学生最合适。本地跑通需要一台带 CUDA 的 GPU,不过纯推理用小模型也可以 CPU 勉强凑合;不需要额外 API Key,所有资源都是开源开放的。Apache-2.0 许可,商用前建议自己再看一遍 LICENSE。想了解具体支持哪些机器人型号、怎么采数据,直接看 README 的快速开始部分,顺便去 Issues 里瞄一眼社区最近的踩坑记录。仓库入口:huggingface/lerobot

GitHub项目

TGI 推理服务:本地大模型从 Demo 到上线还差这层

在本地把 Llama/Qwen 跑通不难,难的是把它变成能扛真实请求的在线服务。text-generation-inference(TGI)是 Hugging Face 官方的推理服务端,把连续批处理、量化、流式输出这些部署琐事收进一个进程,适合正在做模型上线或 RAG/Agent 后端的人。核心看点- 一条命令起服务:模型从 HF Hub 下载后,用 Docker 就能拉起推理接口,不用自己拼 web 服务。 - 部署细节内置:支持 GPTQ / AWQ / bitsandbytes 等量化方式,也处理流式输出和消息模板,省去重复的 prompt 工程。 - 生态贴合 HF:底层用 Rust 管理调度,Python 侧接入方便,配合 InferenceClient 或 OpenAI 兼容客户端都能联调。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示想少踩坑,先看 README 里的 Docker 镜像与模型约束再动手;默认适合带 GPU 的 Linux 环境,显存和 CUDA 版本随模型差异而定。拉模型走 HF Hub,网络受限就提前配镜像。仓库许可证为 Apache-2.0,公共模型不需要 API Key,私有模型则按官方 README 准备 token。如果只是想让本地大模型跑到生产环境,这个仓库值得反复比照;它更新节奏稳定,Release 和 Discussions 里能看到镜像版本与模型兼容的演进——查看 text-generation-inference

GitHub项目

Kohya’s GUI:训练LoRA模型的全能画布,轻松定制你的SD风格

如果你玩Stable Diffusion,迟早会想训练自己的LoRA——角色、画风或物体,而Kohya's GUI正是开源社区里最受欢迎的图形化训练工具箱。它把SD模型的LoRA、DreamBooth、Textual Inversion训练流程封装成直观界面,省去手写脚本的麻烦,适合想要微调模型的AI绘画爱好者。核心看点- 全流程图形化:从数据打标、配置参数到启动训练,全程在浏览器中操作,初学者也能快速上手。支持自动打标(Tagger)、正则化图像、学习率调度等功能。 - 多后端兼容:底层跑在PyTorch上,支持Windows/Linux,可调用NVIDIA GPU(CUDA)或AMD ROCm。原生集成xformers、DeepSpeed等优化,显存八仙过海。 - 活跃社区与模板生态:仓库持续更新,Issue/PR响应快。网上有大量预设配置文件,你只需改几项路径就能开始训练,大大降低门槛。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合想微调SD风格但不想写训练脚本的AI画师、设计师或爱好者。依赖Python 3.10+和NVIDIA显卡(建议8GB以上显存),可用CPU但会很慢。无需API Key,全部本地运行。许可证为Apache-2.0,可自由使用和修改。打开仓库的Releases页面下载打包版或直接pip install,跟着README里的Quick Start就能跑通第一个LoRA。更多技巧藏在Wiki和Discussions里,很适合逐个探索:Kohya's GUI官方仓库。

GitHub项目

MinerU:PDF 文档解析利器,让大模型吃透复杂排版

处理 PDF 中的多栏、表格、公式和页眉页脚,一直是 RAG 和文档理解管线里的老大难。MinerU 由书生·浦语团队开源,能把 PDF 干净地转成 Markdown 或 JSON,保留结构和元数据,让后续的 embedding、切片、检索不再被乱序文本拖累。适合正在搭建高质量知识库、需要从论文/财报/合同里提取结构化信息的开发者或研究者。核心看点- 高保真版面还原:内置 OCR 与布局检测模型,能识别标题层级、表格、图片与公式,输出接近原版排版的 Markdown,表格和数学公式不会碎成乱码。 - 多粒度输出:支持按段落、按页面、按元素类型(文本/表格/图片)提取,可直接对接 LangChain、LlamaIndex 等 RAG 框架。 - 轻量部署:纯 Python 实现,依赖 PyTorch 和 Detectron2,单张消费级 GPU 即可运行推理,也提供 CPU 模式(速度下降但可用)。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 正在做文档问答、论文综述、企业合同分析的团队,需要将 PDF 转化为干净的文本源。 - 对开源许可证友好(Apache-2.0),可商用,无需额外 API Key,所有模型权重随仓库下载。MinerU 不是万能 OCR,但在复杂 PDF 上的表现远超 PyMuPDF 等传统工具。不妨从 README 的快速示例跑起,看看它如何处理你手头最乱的文档: MinerU

GitHub项目

GPT-SoVITS:1分钟音频即可克隆声音,开源语音合成利器

厌倦了需要海量训练数据才能用的语音克隆工具?GPT-SoVITS 让你用一分钟的参考音频就能生成自然、富有表现力的合成语音。无论是做有声书、视频配音还是个人语音助手,这个开源项目直接降低了门槛,尤其适合内容创作者和AI音频研究者。核心看点- 极少数样本下的高质量合成:结合 GPT 语义理解与 SoVITS 声码器,仅需1分钟甚至更短的参考语音即可完成声音克隆,输出效果接近真人。 - 中英双语支持与音色控制:原生支持中文和英文,可通过参考音频控制副语言特征(语气、停顿、重音),让合成更自然。 - 易上手的 WebUI 与跨平台:提供整合的 Web 交互界面,无需复杂命令行;支持 Windows / Linux / macOS,并附有预训练模型下载引导。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示建议使用 NVIDIA GPU(显存≥4GB)以获得最佳推理速度;首次使用需下载底模和编码器(仓库提供一键脚本)。若仅做推理,集成包开箱即用;若要微调,需要准备少量干净音频并理解基本训练流程。许可证为 CC BY-NC 4.0,非商用场景可自由使用。如果你正在找生产级别的开源语音克隆方案,不妨直接打开仓库的 README 和 releases,那里有详细的安装教程、预训练权重链接以及社区交流入口:GPT-SoVITS GitHub 仓库

GitHub项目

browser-use:让AI替你控制浏览器,填表下单自动化一步到位

如果你觉得写爬虫脚本太麻烦,或者手动重复网页操作浪费时间,这个仓库就是为你准备的。browser-use 是一个基于大语言模型的浏览器自动化代理,能让AI像人一样在浏览器里点击、输入、滚动,直接执行复杂任务——从批量填表到自动化数据采集,全程只需自然语言指令,适合追求效率的开发者或需要对现有业务流程做无侵入改造的团队。核心看点- 自然语言驱动,零门槛上手:无需编写选择器或XPath,用一句话描述目标(比如“帮我登录知乎,把今日热榜前十条保存成Markdown”),AI自动拆解步骤并操作浏览器。 - 深度集成多种大模型:底层支持GPT-4o、Claude 3.5等主流模型,也兼容本地部署的开源模型(通过Ollama),灵活应对隐私或成本敏感场景。 - 可观察性与错误恢复:实时输出每个动作的思考日志,遇到验证码或页面变更时能自主调整策略,而不是直接崩溃。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁Web自动化老手可以把它当成“大脑”替代繁琐的Selenium脚本;产品经理或运营则能直接让AI执行竞品数据巡检、定时打卡等重复劳动。依赖方面,只需Python 3.10+和一个Chrome/Firefox浏览器,配合OpenAI API Key或本地模型即可开始。注意涉及敏感网站时请遵守目标网站的服务条款。项目文档提供了Quickstart示例和完整的Action列表,建议先跑一遍Demo感受“AI替你操作”的丝滑。更多使用技巧和社区踩坑记录,可以直接去仓库的Issues和Discussions里翻——browser-use GitHub 主仓库 里已经有大量真实案例等你挖掘。

GitHub项目

Meta SAM 2:开源图像分割模型,物体追踪与视频遮罩一气呵成

搞计算机视觉的朋友肯定对 Meta 的 SAM 不陌生,现在它的升级版 SAM 2 来了。这个仓库把图像分割和视频对象追踪融合进了单一模型架构,你只需要点一下或画个框,就能在单帧上分割出物体,然后模型会自动追踪它在视频后续帧中的遮罩。对于需要精细处理视频素材的开发者、研究者来说,这意味着告别传统逐帧标注或分离的图像分割 + 追踪管线。核心看点- 统一图像与视频分割:不再需要两个独立模型。SAM 2 用同样的权重同时处理静态图和动态视频,输出像素级精确的遮罩。 - 交互式与自动模式双管齐下:你可以通过点击、框选或涂鸦给出提示,模型立即响应;也能配合 Grounding DINO 等文本检测器实现“用文字找物体并分割”。 - 推理高效,内存友好:基于 Transformer 的架构设计,对中等显卡(如 RTX 4090)就能流畅跑视频分割,官方提供了多种预训练权重和 ONNX 导出方案。仓库基于 Apache-2.0 许可证开放。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示典型场景包括视频编辑中的对象替换、医学影像病灶追踪、自动驾驶中动态障碍物的实例分割。你需要 Python 3.9+、PyTorch 2.0+,以及至少 16GB 显存的 GPU(建议 24GB 以上跑高清视频)。无需第三方 API Key,所有模型权重可直接从 Hugging Face 下载。安装指令和 Colab 示例都在 README 里写得很明白,半天内就能跑通第一个 demo。更多细节和社区讨论可以到仓库的 Discussions 里翻翻,不少人已经贴出了有趣的视频遮罩用例。如果你对 SAM 2 的实现原理或部署优化感兴趣,不妨直接看 README 中关于模型架构和训练数据的部分,链接在这里:meta sam 2 仓库主页。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.