跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

CrewAI:多Agent协作框架让AI团队像人类一样分工

还在为单个大模型无法完成复杂任务而烦恼?CrewAI 帮你组建一支「AI 特工队」——通过角色定义、任务分配和流程编排,让多个 Agent 像人类团队一样协作完成端到端工作流。无论是写代码、做调研还是生成报告,它都能让每个 Agent 各司其职,省去你手动调度模型的麻烦。核心看点- 角色化 Agent 设计:为每个 Agent 分配角色(如研究员、写手、审核员)、目标和背景故事,让模型行为更可预测,协作更自然。 - 灵活的流程控制:支持顺序执行、层级管理和自定义路由,轻松编排复杂任务链,还能嵌入工具调用(搜索、API、代码执行)。 - 轻量且可扩展:基于 Python,依赖简单,可无缝对接 OpenAI、Anthropic 或本地模型(通过 Ollama),适合快速原型到生产部署。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 开发者:想快速搭建多 Agent 应用(如自动化报告生成、客服系统),无需从零设计编排逻辑。 - 研究者:试验多 Agent 协作模式(如辩论、共识机制),CrewAI 提供开箱即用的角色与记忆模块。 - 爱好者:在本地用 Ollama 跑开源模型,体验 Agent 团队如何协同工作。无需 GPU,普通 CPU 即可运行小模型。CrewAI 的文档和示例仓库非常完善,从「Hello World」到复杂工作流都有保姆级教程。建议直接去 GitHub 看示例代码和社区讨论,感受一下多 Agent 协作的魔力:CrewAI 仓库

GitHub项目

RAG 新范式:用 GraphRAG 实现知识图谱驱动的检索增强生成,告别简单向量搜索

当传统 RAG 在复杂关系推理上频频碰壁时,GraphRAG 通过将知识图谱与 LLM 结合,让检索不再只是“找相似段落”,而是能沿着实体关系链进行多跳推理。这个仓库由微软研究院开源,提供了完整的 pipeline:从文档中自动抽取实体与关系、构建图索引、再到基于社区的问答生成,特别适合处理需要跨文档、多实体关联的深度知识问答场景。核心看点- 超越向量搜索:不是简单用 Embedding 做相似度匹配,而是构建 实体-关系图,支持全局性、聚合性的查询(如“这些文档中反复出现的关键主题是什么?”)。 - 自动图谱构建:利用 LLM 从原始文本中提取实体、关系和协变量,生成模块化的图结构,无需人工标注。 - 社区级问答:通过 Leiden 算法对图进行层次化社区划分,每个社区自动生成摘要,实现从局部到全局的多粒度回答,比传统 RAG 更擅长处理“总结性”问题。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 需要 Python 3.10+ 和 OpenAI API Key(或兼容端点),本地运行对内存有一定要求(建议 16GB+)。 - 仓库提供了 graphrag.index 和 graphrag.query 两个核心命令,README 中附有完整的使用示例和输出格式说明。 - 许可证为 MIT,社区活跃,Issue 区有大量关于图参数调优和中文文本适配的讨论,值得参考。对知识密集型应用(如企业文档库、科研综述、法律案例检索)的开发者来说,GraphRAG 提供了一条值得深入探索的技术路径。更多细节和配置指南请移步仓库 microsoft/graphrag。

GitHub项目

Chrome 小模型也能跑 RAG:Surya 精准文档 OCR 与版面解析

如果你正头疼 PDF 表格、多栏排版、数学公式在 RAG 流水线中频频丢失语义,Surya 可能是你一直等的那个“文档理解”利器。这个开源项目专为复杂文档 OCR 与版面分析设计,能准确识别文本、表格、公式、页眉页脚,并输出结构化的 Markdown 或 JSON,让后续的检索与问答不再依赖“先转图片再瞎猜”的笨办法。核心看点- 精准版面解析:支持检测标题、段落、表格、图片、公式等 20+ 种区块,对多栏、手写混排、扫描件都有不错的鲁棒性,输出结构可直接喂给 RAG 分块逻辑。 - 轻量级 OCR 引擎:基于 Transformer 架构,不依赖云 API,单张 A100 或 RTX 4090 即可跑出高精度结果,Apache-2.0 许可证下可自由商用。 - 结构化输出与管线友好:能直接输出 Markdown(含表格、公式 LaTeX)、HTML 或带坐标的 JSON,方便与 LangChain、LlamaIndex 等框架集成,省去后处理脏活。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- RAG 应用开发者:需要将 PDF/扫描件拆成语义完整的文本块,Surya 的版面识别能大幅减少“表格被切碎”“公式变乱码”的痛点。 - 文档智能研究者:想快速获得高质量标注数据,或对比不同 OCR/版面分析模型效果。 - 需要本地部署的团队:模型权重约 1.5GB,单 GPU 即可推理,无需调用外部 API,数据安全可控。依赖 Python 3.9+、PyTorch,推荐至少 8GB 显存。无论你是想给 RAG 管线加个“文档理解”层,还是单纯需要比 Tesseract 更聪明的 OCR,Surya 都值得点进仓库细看 README 和在线 Demo。想体验完整能力,直接去 Surya GitHub 仓库 克隆运行,或看看作者提供的 Colab 笔记本。

GitHub项目

Morphic:开源 Perplexity 风格 AI 搜索与 RAG 引擎

厌倦了被封闭生态的 AI 搜索绑定?Morphic 提供了一个可直接部署的 Perplexity 风格搜索体验,基于 Next.js 与 LangChain,让开发者轻松搭建自己的 AI 驱动问答与检索系统。它整合了搜索引擎(Tavily/Serper)、大模型(OpenAI/Anthropic/Ollama)与向量存储,适合想研究 RAG 架构或自建知识搜索工具的工程师。核心看点- 模块化 RAG 管道:从查询重写、网络搜索到上下文注入与流式回答,每一步都可替换组件,方便实验不同检索策略。 - 多模型后端支持:既可用云端 GPT-4/Claude,也支持通过 Ollama 接入本地开源模型(如 Llama 3、Mistral),兼顾成本与隐私。 - 开箱即用前端:基于 Tailwind 的类 Perplexity UI,包含源引用高亮与追问功能,部署后即可体验完整搜索对话。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示需要 Node.js 18+ 与一个搜索引擎 API Key(Tavily 或 Serper,免费额度足够测试)。克隆仓库后复制 .env.example 填入密钥,npm run dev 即可在本地运行;若想用本地模型,额外配置 Ollama 端点即可。项目采用 MIT 许可证,无隐藏收费。想深入 RAG 实现或搭建私有搜索助手?直接看看 Morphic 的 README 与架构图,能帮你少走不少弯路。

GitHub项目

SD WebUI Forge:比A1111更省显存的Stable Diffusion推理引擎

还在用AUTOMATIC1111跑图时频繁爆显存?Forge是lllyasviel在同一个UI框架下做的深度优化分支,直接替换启动器就能感受到内存占用和生成速度的改善,特别适合显存吃紧又想跑大模型、多ControlNet的用户。无论是开发者研究LoRA训练,还是爱好者日常生图,这个仓库都能让老显卡再战几年。核心看点- 内存与注意力机制重构:替换了默认的Cross-Attention实现,大幅降低显存峰值,实测6GB卡也能跑1024分辨率+多个ControlNet,不再轻易OOM。 - 100%兼容原生态:所有A1111的扩展(如ControlNet、ADetailer、LoRA)直接迁移,几乎不改动操作习惯,启动参数也完全一致。 - 持续迭代与社区响应:作者几乎每周都有提交,修复bug和兼容新版PyTorch的速度比原版还快,Issues里讨论氛围也务实。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示如果你是A1111用户,直接把原版启动器换成webui-user.bat(Windows)或webui.sh(Linux)就能切到Forge;需要至少6GB VRAM才能流畅使用推荐的模型组合。项目基于Apache-2.0许可证,预编译的PyTorch包会自动下载,不用手动配什么API Key,解压即跑。要是想试试看真实体感,直接去stable-diffusion-webui-forge的README看一键启动命令,或者翻翻社区的Workflow分享,比看截图更直观。

GitHub项目

Outlines:让 LLM 输出严格遵循 JSON 模式的可靠生成框架

你是否受够了 LLM 胡编乱造 JSON 格式?Outlines 是一个轻量但强大的 Python 库,让大模型输出严格遵循你定义的 Pydantic 模型或 JSON Schema,无需反复提示词调优。它通过约束解码(constrained decoding)在生成阶段直接控制 token 采样空间,特别适合需要结构化输出的 Agent、RAG 链路和 API 后端开发者。核心看点- 声明式结构化输出:直接传入 Pydantic 类或 JSON Schema,模型生成的结果自动匹配格式,支持嵌套、可选字段和枚举约束。 - 多后端兼容:原生支持 llama.cpp、vLLM、Transformers 以及 OpenAI API 兼容接口,一套 API 切换本地和云端模型。 - 轻量无侵入:不修改模型权重,仅通过正则或 FSM(有限状态机)在采样时引导生成,推理速度几乎无损失。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁正在构建 函数调用、数据抽取、表单生成、SQL 查询生成 等需要可靠结构化输出的开发者。依赖 Python 3.8+,无需 GPU 即可使用 OpenAI 后端;若本地部署,推荐配合 llama.cpp 或 vLLM 使用。项目采用 Apache-2.0 许可证。想彻底告别 JSON 解析异常?去 Outlines 的 README 看看它如何用几十行代码搞定复杂约束,社区还提供了丰富的 Pydantic 示例。

GitHub项目

GPT-SoVITS:1分钟音频即可克隆声音,开源语音合成利器

厌倦了需要海量训练数据才能用的语音克隆工具?GPT-SoVITS 让你用一分钟的参考音频就能生成自然、富有表现力的合成语音。无论是做有声书、视频配音还是个人语音助手,这个开源项目直接降低了门槛,尤其适合内容创作者和AI音频研究者。核心看点- 极少数样本下的高质量合成:结合 GPT 语义理解与 SoVITS 声码器,仅需1分钟甚至更短的参考语音即可完成声音克隆,输出效果接近真人。 - 中英双语支持与音色控制:原生支持中文和英文,可通过参考音频控制副语言特征(语气、停顿、重音),让合成更自然。 - 易上手的 WebUI 与跨平台:提供整合的 Web 交互界面,无需复杂命令行;支持 Windows / Linux / macOS,并附有预训练模型下载引导。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示建议使用 NVIDIA GPU(显存≥4GB)以获得最佳推理速度;首次使用需下载底模和编码器(仓库提供一键脚本)。若仅做推理,集成包开箱即用;若要微调,需要准备少量干净音频并理解基本训练流程。许可证为 CC BY-NC 4.0,非商用场景可自由使用。如果你正在找生产级别的开源语音克隆方案,不妨直接打开仓库的 README 和 releases,那里有详细的安装教程、预训练权重链接以及社区交流入口:GPT-SoVITS GitHub 仓库

GitHub项目

txtai:全能AI语义搜索与工作流引擎,一键本地化

如果你厌倦了为搜索、RAG、知识图谱分别搭建不同服务,txtai 用一个 Python 库把这一切打包了。它基于嵌入式向量数据库,让你仅需几行代码就能在本地跑起语义搜索、LLM 驱动的对话、文档摘要、工作流编排,甚至还能做多模态(图像/文本)联合检索。适合希望快速构建内部知识库、个人助理或轻量级 RAG 应用的开发者与数据科学家。核心看点- 一体化架构:内置向量索引、SQL 查询、LLM Orchestration(支持 Hugging Face 模型、Ollama、OpenAI API 等),无需拼凑多个组件。 - 工作流引擎:通过 YAML 配置或 Python API 定义多步处理管道(如提取→摘要→存储→检索),可串联 Embeddings、翻译、文本提取等操作。 - 多模态与扩展性:支持图像/文本联合嵌入(如 CLIP),并提供 REST API、pip 安装即用,Apache-2.0 许可,社区活跃。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 个人知识管理玩家:把本地的 Markdown 笔记、PDF 文档、网页快照做成可语义搜索的私人图书馆。 - AI 原型开发者:快速验证 RAG、Agent 或文档问答场景,无需折腾 Milvus/Elasticsearch 等重型组件。 - 边缘/离线场景:全本地运行(可选 GPU 或无),依赖 Python 3.8+,小模型也可工作。打开仓库 README 看看内置的 50+ 示例笔记本,你会发现从“给 PDF 做问答”到“构建多轮对话工作流”都能直接套用。更多玩法请戳 txtai GitHub 主页。

GitHub项目

SWE-agent:让 LLM 自动修 GitHub Issue 的智能体框架

开发者最头疼的日常之一:打开 Issue 列表,面对一堆复现步骤和报错日志。SWE-agent 直接把 LLM 变成了能读代码、写补丁、跑测试的“虚拟工程师”——给定一个 GitHub Issue,它能自主理解仓库结构、编辑文件、执行命令,最终提交修复 PR。适合想用 AI 自动化代码维护的团队、研究 LLM 工具调用能力的开发者,以及任何被 Issue 淹没的开源维护者。核心看点- 端到端 Issue 修复:输入 Issue 链接,智能体会自动克隆仓库、定位相关文件、生成 diff 补丁,甚至尝试运行测试验证修复是否正确。实测在 SWE-bench 基准上达到 12.3% 的解决率(2024 年初数据),远超之前的方法。 - 可定制的 Agent-Computer 接口:框架将 LLM 与 Linux 环境(bash、文件系统、编辑器)解耦,你可以替换底层模型(GPT-4、Claude 等),或自定义工具集——比如只允许读取代码而不允许执行。 - 完整的反馈循环:每次代码编辑后,Agent 会读取错误输出或测试结果,迭代修改直到通过。整个过程透明可追溯,所有交互日志都保存在本地。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 想用 LLM 自动化代码 BUG 修复的团队,需要 README 中的 Docker 环境(无需 GPU,但推荐 16GB+ RAM)。 - 研究 Agent 工具调用与规划的研究者,仓库提供了详细的论文复现脚本和评估数据集。 - 注意:目前主要面向 Python 代码库,且需要 GitHub 令牌(用于克隆仓库)和 OpenAI / Anthropic API Key。想立刻让 LLM 帮你修一个 Issue?直接访问仓库首页 SWE-agent,用 pip install sweagent 开始体验。别忘了先看 examp…

GitHub项目

Qwen2.5:阿里通义千问新一代开源大模型,多尺寸与长上下文

如果你正在寻找一个既能跑在消费级显卡上、又能处理超长上下文的开源大模型,Qwen2.5 系列值得你立刻点开。阿里云通义千问团队最新发布,覆盖从 0.5B 到 72B 共 7 个尺寸,全部开源且支持 128K tokens 上下文,Apache-2.0 许可,无论是研究实验还是生产部署都能找到合适的版本。核心看点- 全尺寸覆盖与灵活部署:从 0.5B 的轻量级模型(适合手机或端侧推理)到 72B 的旗舰版本(需要多卡 GPU),中间还有 1.5B、3B、7B、14B、32B 等梯度,开发者可根据硬件和场景自由选择。 - 超长上下文与多语言能力:原生支持 128K tokens 上下文窗口,且在多语言基准(包括中文、英文、代码、数学)上表现优异,尤其适合需要处理长文档、对话历史或代码库的 RAG/Agent 应用。 - 开源生态友好:模型权重已在 Hugging Face 和 ModelScope 发布,兼容 vLLM、llama.cpp、Ollama 等主流推理框架,微调也可直接接入 LLaMA-Factory,上手门槛极低。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 依赖与硬件:最小 0.5B 模型可在 CPU 或 4GB 显存的 GPU 上运行;72B 推荐使用 4×A100(80GB)或更高配置。无需 API Key,全部离线部署。 - 典型场景:长文档问答、代码生成与修复、多轮对话 Agent、本地知识库 RAG 系统。建议优先尝试 7B/14B 版本,在效果与资源消耗间取得平衡。 - 快速开始:通过 transformers 或 vLLM 加载模型,参考仓库 README 中的示例代码即可在 5 分钟内跑通推理。更多细节(如微调脚本、量化配置、Benchmark 结果)都写在仓库的文档里,建议直接去 README 的“模型列表”与“快速…

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.