跳到内容

晚上好,辛苦一天了,放松一下吧。

GitHub项目

共 114 篇文章

GitHub项目

LangGraph:用状态图搞定复杂AI Agent工作流编排

搞Agent应用时,最头疼的就是多步推理、工具调用、人机交互这些状态管理。LangGraph把LangChain的链式调用升级成了有向图,每个节点是一个步骤,边决定流转逻辑,状态显式维护,写复杂Agent就像画流程图一样清晰。如果你是LangChain用户但对Agent编排感到力不从心,这个仓库值得你花五分钟看看。核心看点- 图结构代替链式调用:允许循环、分支、并行,天然支持多轮对话、工具重试、条件跳转等非线性的Agent行为,不再需要手写状态机。 - 内置记忆与持久化:节点可以读写共享状态,支持检查点(checkpoint)机制,重启后能恢复对话或流程,适合长时间运行的任务。 - 与LangChain生态无缝衔接:你的LCEL链、Tool、Runnable都可以直接当节点用,迁移成本极低;同时提供人类介入反馈(human-in-the-loop)的原生接口。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示推荐Python 3.10以上,配合LangChain 0.1+使用。不需要GPU,纯CPU也能跑流程编排。如果你熟悉LangChain的Runnable协议,半小时就能把一条简单的链改成图。项目采用MIT许可证,文档和示例都写在仓库的docs目录和examples文件夹里,上手直接看quickstart.ipynb就行。选一个你手头需要多步推理或工具调用的场景,试试把@chain装饰器换成GraphBuilder,体验一下状态图带来的清晰感。更多细节和高级模式(比如并行节点、子图)可以直接去LangGraph的README挖宝。

GitHub项目

FastChat:大模型部署与聊天评测的开源利器,开发者必看

如果你正为部署一个大模型做聊天服务而焦头烂额,或者想快速对比不同模型的对话效果,FastChat 可能是最直接的开源答案。这个由 LMSYS 组织维护的项目,提供了从训练到服务的一整套工具链,尤其擅长高并发推理与标准化的模型评估,非常适合研究者或需要搭建私有 ChatGPT 的开发者。核心看点- 闪电级推理服务:基于 vLLM 的优化推理引擎,支持多 GPU 分片、连续批处理,单机即可处理数百并发请求,官方提供的 Vicuna 系列模型就是用它跑起来的。 - 标准化评测系统:内置 MT-Bench 和 Chatbot Arena 评测流程,你可以一键对比自家模型与 GPT-4、Claude 等标杆的对话质量,结果直接输出排行榜。 - 灵活的模型兼容性:不仅支持 LLaMA、Mistral 等开源模型,也能加载 Hugging Face 上任意对话模型,通过简单的 --model-path 参数即可启动,无需繁琐修改。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示推荐在 Linux 环境部署,Python 3.9+,至少一张 24GB 显存的 GPU 即可运行 7B 模型。pip install fschat 安装后,运行 python -m fastchat.serve.controller 和 python -m fastchat.serve.model_worker --model-path your-model,再加一个 Gradio 界面即可对练。无需 API Key,全部本地可控。想看看它怎么支撑真实的大模型评测生态?直接去仓库 README 翻翻 arena 文件夹,或者跑通 scripts/train_vicuna.sh 里的训练流程。快戳 FastChat 仓库 体验吧。

GitHub项目

想用自然语言写脚本?gptscript 让 AI 直接调度 API 与工具

写脚本时常常要查文档、拼参数,gptscript 想改变这件事:用一段自然语言描述你要做什么,它就能自动调用大模型来拆解任务、执行 API 调用和本地工具。对开发者来说,这意味着可以把日常自动化、数据查询、甚至 CI/CD 流程写成可读的“描述”,而不是堆代码。仓库采用 Apache-2.0 许可,README 清晰地列出了安装、运行和自定义工具链的步骤,最近还在持续加新功能和修复 issue。核心看点- 自然语言驱动:只要用英文描述目标(比如“下载最近 10 条 GitHub Release 信息并汇总成邮件”),gptscript 就会自动规划步骤、调用内置或自定义的工具完成,不需要手写 curl 或 Python 胶水。 - 可扩展的工具生态:支持接入任意 HTTP API、脚本、甚至第三方 Agent,开发者可以把自己的本地命令或微服务注册为 gptscript 的“工具”,复用性很强。 - 运行透明可调试:命令行模式下会打印每一步的推理过程和工具调用详情,方便你理解它到底做了什么,也方便修正 prompt 或工具描述。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁后端/DevOps 开发者、AI 应用原型师,以及任何希望通过自然语言快速编写自动化脚本的人。依赖很简单:只需要一个 Python 3.10+ 环境,以及一个 OpenAI API Key(或兼容接口),无需 GPU。第一次试用可参考仓库里给的“5 分钟快速开始”示例。用 gptscript 写脚本就像跟同事交代任务——试试看修改描述里的措辞,还能得到完全不同的执行路径。详细用法和工具注册方法都在 gptscript 官方仓库的 README 里,值得花几分钟翻一翻。

GitHub项目

InvokeAI:像画家一样操控AI生图,Stable Diffusion的自由画板

受够了手动拼凑ComfyUI节点或折腾WebUI的参数?InvokeAI 把Stable Diffusion的生成过程变成了直觉化的画布操作——构思、修改、重绘一气呵成。无论你是想快速出图的设计师,还是折腾底层的AI玩家,这个仓库都能让你少写很多脚本。核心看点- 统一画布界面:支持图像到图像、修复、扩展、ControlNet 一次性拖入,无需切换标签页,所有操作像 Photoshop 图层一样直观。 - 模型与 LoRA 热加载:不用重启服务就能切换基础模型、更改 LoRA 权重,支持快速对比不同风格版本的效果。 - 内嵌 ControlNet 与 IP‑Adapter:无需额外安装插件即可使用姿态、深度、边缘等控制条件,搭配统一的高分辨率放大管道。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁特别适合追求“即开即用”的创作者,或希望用统一工作流管理多个模型的玩家。依赖最低一张 6GB 显存的 NVIDIA 显卡,支持 macOS (MPS) 和 CPU 模式加速,安装后通过浏览器直接操控。项目使用 MIT 许可,全部功能开源无暗桩。想体验画布式生图,直接去仓库 Release 页下载整合包或跟着 README 的 pip install 走一遍,动手最快。 点击进入 InvokeAI 仓库

GitHub项目

MLX:苹果官方出品,让你的Mac也能高效跑大模型推理和微调

MLX是苹果开源的机器学习框架,专为Apple Silicon设计。如果你手边只有Mac却想本地跑Llama、Mistral甚至做LoRA微调,MLX让你利用统一内存架构,实现接近NVIDIA GPU的效率。无需昂贵显卡,轻松上手。核心看点- 统一内存与高效算子:CPU和GPU共享内存池,支持超大序列长度(比如8K+ token上下文),算子自动优化,推理速度在M2 Ultra上不比桌面级GPU差。 - Python原生 + Transformer生态:API设计极简,一行代码切换设备。社区已移植主流模型(mlx-examples仓库含Llama、Stable Diffusion、Whisper等),直接加载Hugging Face权重就能跑。 - 支持LoRA / QLoRA微调:官方提供完整的微调脚本,PEFT低成本适配自己的数据集,苹果芯片本地就能训,复现成本极低。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示最适合Mac开发者、AI爱好者在没有远程GPU时做原型验证。需要macOS Ventura+、Apple Silicon(M1及以上)。直接pip install mlx mlx-lm即可,无需API Key。建议从mlx-examples里的Llama推理脚本入手,五分钟跑通。更多示例和社区模型列表,一定要去仓库的README和Examples目录逛逛,那里有完整的入门教程和微调指南:MLX - GitHub。

GitHub项目

CopilotKit:给任何React应用加上可定制的AI聊天搭档

如果你正在开发一个React应用,想在产品里加一个能理解上下文、能操作界面的AI助手,而不是一个简单的对话框,那CopilotKit值得一看。它不是一个聊天UI组件库,而是一个让你在现有应用里无缝嵌入“AI Copilot”的框架,支持文本、代码生成、甚至直接调用你后端的API和工具。特别适合那些想做智能客服、代码编辑器、数据分析面板,但又不想从头折腾Agent编排的团队。 ## 核心看点 - **React原生集成**:用``包装你的应用,再写几个`useCopilotAction`就能定义AI可以调用的函数,上手非常快。仓库README里有清晰的5分钟快速开始demo,跟着做一遍就能跑起来。 - **支持多种LLM后端**:默认兼容OpenAI、Anthropic、Ollama等常见接口,可以替换成自部署模型。**内置RAG支持**,让AI能引用你应用里的实时数据回答。 - **交互式反馈与流式渲染**:AI生成内容时可以实时流式打字,用户还能对局部结果点赞或修改。这个体验和Cursor、GitHub Copilot很像。 ## 适用场景 你有一个React项目(Next.js、Remix等均可),希望给用户提供一个能“动手”的AI助手——比如“帮我筛选订单”“把这行代码重构一下”。你需要准备一个LLM API Key(如果自建Ollama则不需要),然后按项目文档配置即可。无需特殊硬件,纯JavaScript / TypeScript生态。项目采用MIT许可证,所有代码和示例都在GitHub上。 不用费劲拼装Agent框架,直接看 [CopilotKit的GitHub仓库](https://github.com/CopilotKit/CopilotKit) 的README,从“Quick Start”开始,10分钟就能在自己的App里跑起一个定制AI搭档。▲…

GitHub项目

Diffusers 0.33:用统一 API 玩转文生图与视频生成,开发者的新起点

如果你还在为集成 SD、Flux、CogVideoX 等模型而拼凑零散代码,那不妨看看 HuggingFace 的 Diffusers。这个库把主流扩散模型打包成一套简洁的 Pipeline,无论是文生图、图生图还是视频生成,切换模型只需改几行参数。配合 HuggingFace Hub,模型权重和配置文件一键拉取,无需手动搬运。核心看点- 统一的 Pipeline 架构:StableDiffusionPipeline、FluxPipeline、CogVideoXPipeline 等几十种 Pipeline 共享相同调用方式,from_pretrained 加载、.to('cuda') 推理,新手也能秒上手。 - 社区扩展生态丰富:内置 LoRA、ControlNet、IP-Adapter 等热门训练和推理插件,无需改主代码即可实现换脸、姿势控制、风格迁移。官方还持续跟进最新论文,如 FLUX、SD3 首发即支持。 - 训练与微调一站式:提供训练脚本和示例,配合 accelerate 和 diffusers 自带的 train_text_to_image_lora.py,你能在消费级显卡上快速微调模型,并共享到 Hub。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁面向需要快速实验或构建生成式 AI 应用的开发者、研究者和创作者。依赖 Python 3.8+ 和 PyTorch,建议配备 GPU(至少 8GB 显存),但 CPU 推理也可行。所有模型均开源,无需 API Key;使用前请务必确认各模型权重仓库的 LICENSE 条款(部分模型有非商业限制)。Diffusers 不仅是工具箱,更是社区生态的入口。无论是想复现最新论文、做二次开发,还是想自己动手训练个性化模型,这里都能让你少踩不少坑。快去仓库的 README 和示例目录…

GitHub项目

Plandex用AI在终端跑长任务,治好了我的半途而废症

如果你经常打开ChatGPT写代码,却因为对话太长、上下文丢失、需求一变就重来,最后放弃——那Plandex就是为你准备的。它把AI助手直接搬进终端,专门解决“大型、多步骤开发任务”的痛点。无论是重构模块、写测试还是搭脚手架,你只需描述目标,Plandex会自动拆解子任务、按顺序执行、遇到错误自动重试,所有状态持久保存,关了终端下次继续。对命令行老手和AI编程重度用户来说,这套工作流比会话式ChatGPT靠谱太多。核心看点- 任务持久化与断点续跑:所有AI执行状态保存在本地,关掉终端再打开,输入plandex continue就能从上次失败或中断的地方接着干,再也不怕对话被清空。 - 自动任务拆解与分步执行:你只给一个高层面目标(比如“给这个FastAPI项目加JWT认证”),AI会自动拆成多个步骤,每步生成或修改代码,你随时review和调整,像结对编程一样可控。 - 多模型支持与上下文管理:默认集成OpenAI,但可切到Anthropic Claude等;内部用精简的上下文策略避免token浪费,同时保留关键历史,跑大型重构也不会突然失忆。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示装一个Node.js(>=18),然后npm install -g plandex就能开用。无需GPU,不依赖Python环境,对机器配置几乎零要求。首次运行需配一个OpenAI API Key或兼容接口。典型场景:拉下一个新仓库快速理解代码、批量改接口命名、自动给老函数补单元测试。如果你是Vim或Tmux用户,配合起来非常顺手。Plandex的持久化工作流和分步把控的思路,值得每个想把AI真正写进开发流的人试试。去仓库 README 看它怎么拆解一个“邮件发送功能”的例子,很快就能上手:Plandex 仓库

GitHub项目

OpenAI Swarm:轻量多Agent框架,几百行代码搞定协作编排

你在为多Agent之间的消息路由和工具调用头疼吗?OpenAI 刚开源的 Swarm 直接抛出了一个极简方案——不依赖 LangChain 那种厚重的抽象层,只用函数调用和循环队列让 Agent 互相“对话”,整个核心不到 300 行 Python。如果你平时折腾 Agent 编排、想快速验证多角色协作场景,这个仓库值得点开细看。核心看点- 极简API:Agent 就是一个 dict + 一个函数列表,通过 run() 启动后自动处理上下文切换和工具调用,新手也能半小时跑起来第一个多Agent流程。 - 无外部依赖:只要 Python 3.10+ 和 OpenAI SDK,无需 Redis、数据库或额外中间件,本地就能复现 ChatGPT 那样的多轮对话调度。 - 可扩展性:支持函数注册、Agent 间函数传递(handoff),你能用几行代码实现“质检员→修正员→审核员”的流水线,适合做 AIGC 内容审核或客服分流。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示项目采用 MIT 许可证,直接 pip install swarm 或克隆仓库就能用。典型场景是快速原型验证:比如让一个 Agent 阅读文档并提取摘要,再传给另一个 Agent 生成报告。需要 OpenAI API Key 才能调用实际模型,但仓库自带了模拟测试接口,不联网也能体验核心逻辑。GPU 不是必须的,完全依赖云 API。想看看怎么用 5 个函数定义出一组助手团队?赶紧去仓库的 README 和示例目录翻翻,那里有完整的旅游预订、客户支持等现成例子。仓库地址:OpenAI Swarm on GitHub

GitHub项目

Quivr:用RAG打造你的第二大脑,私有知识库开源方案

如果你厌倦了把文档喂给ChatGPT后每次都要重复上传,或者担心数据隐私泄露,那Quivr值得你花两分钟看看。它是一个开源的“第二个大脑”,让你用本地或云端LLM构建私有RAG知识库,直接上传PDF、Markdown、代码文件甚至网页链接,就能像聊天一样检索内部信息。无论是个人笔记管理还是团队内部文档问答,都能用上。核心看点- 即插即用的RAG体验:内置文档解析、向量化存储与检索,支持Ollama、OpenAI等多种模型后端;无需手动写Embedding或向量库配置。 - 多模态输入与权限控制:不止文本,还可以拖入图片、音频(需模型支持),并提供简单的用户/群组权限,适合小团队协作。 - 数据完全自主可控:支持本地部署,用PostgreSQL + Supabase存储向量,无需把数据送进第三方SaaS,满足隐私偏好。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁知识工作者、研究人员、小团队,或任何想将散落文档按语义组织起来的人。依赖Docker、Node.js,可自托管;若使用本地Ollama无需API Key,若用OpenAI则需自己的Key。MIT许可证,放心商用。上手不难:克隆后执行docker compose up,浏览器打开后台,上传文档即开始问答。更详细的使用技巧可以看看仓库的README和官方文档,社区也在Discord里活跃答疑。快去Quivr仓库里点个Star,给你的知识库加个AI引擎吧。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.