跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

Plandex用AI在终端跑长任务,治好了我的半途而废症

如果你经常打开ChatGPT写代码,却因为对话太长、上下文丢失、需求一变就重来,最后放弃——那Plandex就是为你准备的。它把AI助手直接搬进终端,专门解决“大型、多步骤开发任务”的痛点。无论是重构模块、写测试还是搭脚手架,你只需描述目标,Plandex会自动拆解子任务、按顺序执行、遇到错误自动重试,所有状态持久保存,关了终端下次继续。对命令行老手和AI编程重度用户来说,这套工作流比会话式ChatGPT靠谱太多。核心看点- 任务持久化与断点续跑:所有AI执行状态保存在本地,关掉终端再打开,输入plandex continue就能从上次失败或中断的地方接着干,再也不怕对话被清空。 - 自动任务拆解与分步执行:你只给一个高层面目标(比如“给这个FastAPI项目加JWT认证”),AI会自动拆成多个步骤,每步生成或修改代码,你随时review和调整,像结对编程一样可控。 - 多模型支持与上下文管理:默认集成OpenAI,但可切到Anthropic Claude等;内部用精简的上下文策略避免token浪费,同时保留关键历史,跑大型重构也不会突然失忆。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示装一个Node.js(>=18),然后npm install -g plandex就能开用。无需GPU,不依赖Python环境,对机器配置几乎零要求。首次运行需配一个OpenAI API Key或兼容接口。典型场景:拉下一个新仓库快速理解代码、批量改接口命名、自动给老函数补单元测试。如果你是Vim或Tmux用户,配合起来非常顺手。Plandex的持久化工作流和分步把控的思路,值得每个想把AI真正写进开发流的人试试。去仓库 README 看它怎么拆解一个“邮件发送功能”的例子,很快就能上手:Plandex 仓库

GitHub项目

LivePortrait:一张照片让人像动起来,表情驱动开源实现

给一张正面或侧脸照片,再给一段说话或转头的视频,LivePortrait 就能让照片里的脸跟着视频做出眨眼、微笑、歪头这些动作,神态贴合度做得比较自然。它解决了 AI 视频和虚拟人项目里最常见的「图片动起来」难题——不需要 3D 建模,也不用打关键帧,一张图加一个驱动视频就够。对做短视频、数字人、漫画分镜动效的开发者来说,这是可以直接拿去接进工作流的东西。核心看点高精度表情迁移:用隐式关键点同时对嘴型和头部姿态建模,侧脸和夸张表情下依然能保持稳定,生成结果里颈部和头发的跟随也比较顺。训练与推理全公开:项目提供完整训练代码和预训练权重,折腾微调或者只跑推理都有对应文档,不像很多 demo 仓库只放了个空壳。社区生态活跃:已经有人把它接进了 ComfyUI 和直播弹幕互动,意味着你现有的 AI 绘画或视频流程,有机会通过插件直接复用。代码基于 Apache-2.0 发布,模型权重另有条款,动手前先看一眼仓库里的 LICENSE。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示个人开发者用一张消费级显卡就能跑推理,建议先从官方给的示例视频试效果,再换自己的图片。需要 CUDA 环境,推荐用 conda 按 README 建环境;想直接看效果的可以下载模型权重后跑 demo 脚本。如果只是做数字人播报,把驱动视频裁剪成和照片人脸角度接近的比例,效果会更稳。项目主页上有不少演示片段和效果对比,看完再决定要不要往自己的工具链里集成。直接点进仓库看 README 的快速开始: LivePortrait 开源项目

GitHub项目

Transformers.js:不用服务器,浏览器里直接跑大模型推理

如果你主要写前端,又想让页面里直接跑模型,这个库值得点开。transformers.js 把 Hugging Face 生态搬到浏览器和 Node.js,不用维护后端服务也能做文本生成、嵌入、分类、语音识别甚至图像分割。核心看点- ONNX Runtime 后端,模型经 Optimum 转换后能离线加载,支持 WebGPU 加速,特定模型在浏览器里能跑出可用的速度。 - API 对齐 Python 版 transformers,熟悉 transformers 的人可以很快迁移;也提供原生 JavaScript 的 Pipeline 接口。 - 覆盖面广,文本、视觉、音频、多模态任务都有示例,社区持续补充新模型。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁前端开发者、独立开发者,以及想给网页加 AI 能力但不想维护 GPU 服务器的团队。依赖 npm 包,模型权重由 Hugging Face Hub 分发,需注意各模型自身的许可证。推理时浏览器需要较新版本以启用 WebGPU,纯 CPU 也能跑,但速度依模型而定。可以先去 README 看支持模型列表,或到官方示例站试试实时效果,再按任务类型找对应 Pipeline。transformers.js 仓库主页 的 Releases 也常有新模型接入说明,值得关注。

GitHub项目

ChatDev:让AI智能体协作开发,一句话生成完整软件

想用自然语言描述一个想法,然后看到AI智能体自己拆解需求、写代码、修Bug?ChatDev 就是干这个的。它把软件开发流程变成一场多智能体协作——CEO、程序员、设计师各司其职,连续对话后直接产出项目代码,特别适合想折腾 AI 编程、又不想手动拼 Prompt 的开发者。核心看点- 多智能体协作机制:每个角色拥有独立的上下文和任务边界,像真实团队一样分工,需求从拆解到实现一气呵成,比单次 LLM 调用可控得多。 - 端到端生成:从输入一句需求开始,自动生成代码文件、依赖说明甚至运行指引,你拿到的是一个可以直接打开的项目骨架。 - 易扩展与可定制:支持自定义角色、数据存储和后端模型,既可以用云 API,也可以接本地推理服务,改动不算复杂。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示项目以 Apache-2.0 协议开源,仓库里有清晰的快速上手文档。你只需要准备 Python 环境和可用的模型 API Key,不一定需要独立 GPU。建议先把官方示例跑通,再动手改角色设定。生成的代码虽然像模像样,但上生产前依然需要人工检查,把它当成一个高效的结对程序员更合适。喜欢的话,去 ChatDev 仓库 翻翻 README 和示例目录,里面还有不少玩法细节和社区讨论,值得进一步探索。

GitHub项目

Langfuse:看穿每一次 LLM 调用,开源可观测性补上调试短板

开发大模型应用最难受的,不是模型不聪明,而是它为什么返回这么个结果。Langfuse 就是解决这个问题的:把你应用的每次 LLM 调用、Prompt、Token 消耗、追踪链路全部记录成可检索的 trace,方便在网页端直接回放排查。做 RAG、Agent、多轮对话的开发者应该都能用上。核心看点- 全链路可观测:从用户侧请求到模型返回,中间经过的检索、工具调用、重试、降级都能串成一条 trace,排查透明了很多。 - 多语言 SDK 接入简单:官方提供 Python/JS/TS 包,能一行代码挂到 LangChain、LlamaIndex、OpenAI SDK 等生态上,不用侵入业务逻辑。 - 自托管 + 开放协议:仓库采用 MIT 许可,支持 Docker 一键部署,数据留在自己的服务器,在意隐私的团队也能安心用。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示想快速感受,先 docker compose up 起一个本地实例,然后在应用里引入 SDK,设置 Langfuse 的 host 和 project key。跑几句测试就能在 dashboard 看到耗时分段和完整输入输出。单机加 Docker 就够,不需要 GPU。建议再翻一遍仓库 README 里的接入示例和 Telemetry 说明:Langfuse 仓库首页。

GitHub项目

Open-Sora 开源视频生成:本地复现 Sora 级效果

Sora 刷屏之后,很多团队都在拆解怎么复现,Open-Sora 是最早把完整流程摊开来的开源实现之一。它适合想上手视频生成训练/推理的开发者,也值得关注扩散模型架构的爱好者围观。核心看点- 完整训练管线:从视频处理、图像编码到扩散 Transformer 训练都有配套脚本,能看清生成背后的每一环,而不是只调黑盒 API。 - 推理与演示开箱即用:仓库提供 Gradio 示例与预训练权重入口,先跑通生成再谈二次开发,节奏很友好。 - 版本迭代快、社区活跃:代码侧采用 Apache-2.0 许可,结构清晰,适合在此基础上改模型或加数据集。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁比较适合想本地调试视频生成模型的研究者,也适合动手能力强的 AI 爱好者。依赖主要是 PyTorch 环境,具体显存和版本要求以 README 为准;注意权重与代码许可不同,商用前要核对。如果想看到实际生成的视频片段,或者想了解训练配置,直接打开 README 里的快速开始和示例页就行;调参经验可以在 Discussions 里翻一翻。Open-Sora 仓库直达

GitHub项目

Instructor:让大模型输出直接变成 Python 对象

还在对着 choices[0].message.content 手写 JSON 解析,一边担心字段缺失一边写重试?Instructor 就是针对这个场景的库,适合天天和大模型 API 打交道的 Python 开发者。它把「结构化输出」变成声明式配置,模型返回什么、怎么校验,用 Pydantic 一页纸说清楚。核心看点- response_model 一步到位:把 response_model=User 追加到 chat completion 参数里,拿回来的直接是 Pydantic 实例,而不是乱糟糟的字符串。 - 多后端都接得住:OpenAI、Anthropic、Gemini、Mistral,连 llama-cpp-python 本地模型也可以,切换成本比想象中低。 - 自动重试纠偏:模型输出不符合 schema 时,Instructor 会把校验错误传回模型并自动重试,省掉大量后处理代码。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁给 Agent 做函数参数抽取、做信息抽取落库的 AI 应用开发者,或者想少写 prompt 解析逻辑的研究者。需要 Python 3.9+,用云端模型要自己配 API Key;玩本地模型则再加一个 llama-cpp 依赖。许可证是 MIT,源码可直接读。真想提升 Agent 稳定性,与其堆提示词,不如把输出钉在类型上。更多流式与多轮补全的玩法,去 README 里的 examples 挖一挖:instructor 仓库主页。

GitHub项目

llamafile:把大模型打包成单文件,双击就能跑

跑本地大模型是不是总要先装 Python、配 CUDA、再拉一堆依赖?llamafile 把模型权重和推理引擎全部塞进一个可执行文件,双击或一条命令就能启动,适合想快速体验本地模型的开发者,也适合要把模型分发给非技术用户的场景。核心看点- 单文件分发:一个文件同时包含模型和运行时,Linux、macOS、Windows 都能直接执行,省去环境配置的折腾。 - 格式兼容广:支持 GGUF 以及 Llama、Phi、Mistral 等主流架构,命令行里 -m model.llamafile 即可加载,模型文件后缀统一为 .llamafile。 - 自带 Web 聊天界面:启动后自动打开浏览器可视化对话页,无需额外搭前端,同时还提供 OpenAI 兼容 API,方便接入现有工具。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁面向想逃开环境配置的本地推理玩家,以及希望把模型作为独立程序交付给同事或客户的人。CPU 也能跑小尺寸量化模型,不强制要求 GPU;Apache-2.0 许可,个人使用和二次修改都比较自由,具体以仓库 LICENSE 为准。想看看有哪些现成模型可以直接下载体验,或者了解怎么把自己的 GGUF 模型打包成单文件,建议直接逛 README 和 Releases 里的示例资源:Mozilla-Ocho/llamafile

GitHub项目

Qwen-Agent:让通义千问学会调用工具的开源 Agent 框架

写 RAG 或多步推理时,最烦的就是把大模型和工具调用粘在一起自己造轮子。Qwen-Agent 是阿里开源的一套轻量 Agent 框架,专门围绕 Qwen 系列模型设计,装完就能让模型自己决定调什么函数、传什么参数,适合想快速把通义千问接进业务流的开发者。核心看点- 原生函数调用:内置与 Qwen 模型对齐的 tool calling 机制,定义好 JSON Schema 就能让模型自主选择工具,少走 prompt 调优弯路。 - 多 Agent 协同:支持拆分子任务给不同 Agent,再汇总结果,做简单编排不用再引入重型框架。 - 开箱即用:提供命令行交互和 API 两种模式,本地跑通只需 Python 环境加一个模型服务,对研究者和原型验证都很友好。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想用通义千问系列模型落地 Agent 场景的开发者,比如做代码助手、信息查询工具或流程自动化。默认对接 DashScope API,也可以切换到本地部署的 Qwen 模型;需要准备 API Key,但仓库里给了完整的示例和文档,照着改就行。如果你最近正好在对比不同 Agent 框架,值得点开 Qwen-Agent 的 README 看看它的设计取舍,尤其适合搭过 LangGraph 但嫌重的人。

GitHub项目

tinygrad:用很少的代码读懂深度学习与大模型推理

绝大多数人用深度学习框架就是调 API,想亲眼看清张量、自动求导、反向传播到底怎么运作,往往被 PyTorch 那几十万行代码劝退。tinygrad 把核心逻辑压缩得很紧凑,同时又保留了可用的训练和推理能力,适合想拆开黑盒的工程师和研究爱好者。核心看点- 极简内核:用相对很少的代码实现张量、自动求导和常见优化器,阅读它比啃 PyTorch 源码轻松得多。 - 多后端支持:同一套模型可跑在 CPU、CUDA、OpenCL、WebGPU 上,换设备时不用改写业务代码。 - 能训也能推理:既能训练小型模型,也能加载类似 LLaMA 的权重做推理,用来理解大模型内部机制正合适。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想真正理解框架底层原理的开发者,或需要在不同设备上做轻量推理的爱好者。项目基于 Python,依赖少,纯 CPU 环境就能跑;GPU 版需要对应的驱动或 CUDA 环境,不需要 API Key。如果你早已厌倦把框架当黑盒用,点进 README 从代码目录开始走读,会有种豁然开朗的感觉。打开 tinygrad 仓库 看看它是如何在紧凑代码里撑起一个完整的深度学习栈。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.