跳到内容

下午好,继续加油,离目标更近一步。

GitHub项目

共 114 篇文章

GitHub项目

LiteLLM:一套API调用上百种大模型,开发者的多模型切换利器

如果你受够了每次换模型都要重写 SDK 调用代码,LiteLLM 就是那个能“一劳永逸”的轻量代理。它把 OpenAI、Anthropic、Cohere、HuggingFace 等各种大模型的 API 统一成 OpenAI 格式,你只需要改一个字符串就能切换底层模型,适合需要快速测试或生产环境中多模型兜底的开发团队。核心看点- 统一接口覆盖 100+ 模型:从 GPT-4、Claude 到本地部署的 Llama、Mistral,甚至 Azure、Bedrock 等企业端点,全部用同一套参数调用。 - 内置 fallback 与重试机制:当一个模型超时或限流时自动切换到备用模型,不用自己写复杂的重试逻辑。 - 成本与用量透明:支持自定义路由策略,可以在请求级别设定最大预算,避免意外跑单。项目采用 MIT 许可,Python 环境即可运行,依赖简单。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁后端工程师或 AI 应用开发者,正在做多模型集成、A/B 测试、或希望为不同任务(如翻译 vs 代码生成)分配不同模型以控制成本。不需要 GPU,仅需 Python 3.8+,但若要代理本地模型需要搭配 Ollama 或 vLLM 使用。想省掉重复造轮子的时间?直接看 LiteLLM 的 README 和快速入门示例,十分钟就能接入你的项目。

GitHub项目

LangChain:构建LLM应用的首选框架,从原型到生产一步到位

开发AI应用时,最头疼的就是繁琐的模型调用、提示词管理和外部工具集成。LangChain 帮你把这些抽象成模块化组件,让你专注于业务逻辑,而不是重复造轮子。无论你是想做问答机器人、文档分析助手还是自动化Agent,这个框架都能大幅缩短开发周期。核心看点- 统一接口:支持OpenAI、Hugging Face、Claude、本地模型等数百种LLM,切换模型只需改一行配置。 - 预置组件:内置Prompt模板、链式调用、记忆模块、文档分割、检索引用(RAG)等开箱即用,Agent 机制更是能自主调用工具完成任务。 - 生态活跃:Apache-2.0许可证,社区贡献了数百个集成包(LangChain Hub),从向量数据库到Excel操作,什么都接。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示Python 3.8+即可安装 pip install langchain,搭配LangChain CLI或LangSmith调试更爽。无需GPU,但调用外部模型仍需API Key(或自己部署的开源模型)。适合Python开发者、AI产品经理、想快速验证想法的研究者。推荐先去README的「Quickstart」跑一个最简单的LLM链,再翻翻「Use Cases」里的文档问答或聊天机器人示例,你会立刻感受到模块化设计的爽快。仓库地址:langchain-ai/langchain

GitHub项目

MinerU:PDF 文档解析利器,让大模型吃透复杂排版

处理 PDF 中的多栏、表格、公式和页眉页脚,一直是 RAG 和文档理解管线里的老大难。MinerU 由书生·浦语团队开源,能把 PDF 干净地转成 Markdown 或 JSON,保留结构和元数据,让后续的 embedding、切片、检索不再被乱序文本拖累。适合正在搭建高质量知识库、需要从论文/财报/合同里提取结构化信息的开发者或研究者。核心看点- 高保真版面还原:内置 OCR 与布局检测模型,能识别标题层级、表格、图片与公式,输出接近原版排版的 Markdown,表格和数学公式不会碎成乱码。 - 多粒度输出:支持按段落、按页面、按元素类型(文本/表格/图片)提取,可直接对接 LangChain、LlamaIndex 等 RAG 框架。 - 轻量部署:纯 Python 实现,依赖 PyTorch 和 Detectron2,单张消费级 GPU 即可运行推理,也提供 CPU 模式(速度下降但可用)。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 正在做文档问答、论文综述、企业合同分析的团队,需要将 PDF 转化为干净的文本源。 - 对开源许可证友好(Apache-2.0),可商用,无需额外 API Key,所有模型权重随仓库下载。MinerU 不是万能 OCR,但在复杂 PDF 上的表现远超 PyMuPDF 等传统工具。不妨从 README 的快速示例跑起,看看它如何处理你手头最乱的文档: MinerU

GitHub项目

Qwen2.5:阿里通义千问新一代开源大模型,多尺寸与长上下文

如果你正在寻找一个既能跑在消费级显卡上、又能处理超长上下文的开源大模型,Qwen2.5 系列值得你立刻点开。阿里云通义千问团队最新发布,覆盖从 0.5B 到 72B 共 7 个尺寸,全部开源且支持 128K tokens 上下文,Apache-2.0 许可,无论是研究实验还是生产部署都能找到合适的版本。核心看点- 全尺寸覆盖与灵活部署:从 0.5B 的轻量级模型(适合手机或端侧推理)到 72B 的旗舰版本(需要多卡 GPU),中间还有 1.5B、3B、7B、14B、32B 等梯度,开发者可根据硬件和场景自由选择。 - 超长上下文与多语言能力:原生支持 128K tokens 上下文窗口,且在多语言基准(包括中文、英文、代码、数学)上表现优异,尤其适合需要处理长文档、对话历史或代码库的 RAG/Agent 应用。 - 开源生态友好:模型权重已在 Hugging Face 和 ModelScope 发布,兼容 vLLM、llama.cpp、Ollama 等主流推理框架,微调也可直接接入 LLaMA-Factory,上手门槛极低。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 依赖与硬件:最小 0.5B 模型可在 CPU 或 4GB 显存的 GPU 上运行;72B 推荐使用 4×A100(80GB)或更高配置。无需 API Key,全部离线部署。 - 典型场景:长文档问答、代码生成与修复、多轮对话 Agent、本地知识库 RAG 系统。建议优先尝试 7B/14B 版本,在效果与资源消耗间取得平衡。 - 快速开始:通过 transformers 或 vLLM 加载模型,参考仓库 README 中的示例代码即可在 5 分钟内跑通推理。更多细节(如微调脚本、量化配置、Benchmark 结果)都写在仓库的文档里,建议直接去 README 的“模型列表”与“快速…

GitHub项目

SWE-agent:让 LLM 自动修 GitHub Issue 的智能体框架

开发者最头疼的日常之一:打开 Issue 列表,面对一堆复现步骤和报错日志。SWE-agent 直接把 LLM 变成了能读代码、写补丁、跑测试的“虚拟工程师”——给定一个 GitHub Issue,它能自主理解仓库结构、编辑文件、执行命令,最终提交修复 PR。适合想用 AI 自动化代码维护的团队、研究 LLM 工具调用能力的开发者,以及任何被 Issue 淹没的开源维护者。核心看点- 端到端 Issue 修复:输入 Issue 链接,智能体会自动克隆仓库、定位相关文件、生成 diff 补丁,甚至尝试运行测试验证修复是否正确。实测在 SWE-bench 基准上达到 12.3% 的解决率(2024 年初数据),远超之前的方法。 - 可定制的 Agent-Computer 接口:框架将 LLM 与 Linux 环境(bash、文件系统、编辑器)解耦,你可以替换底层模型(GPT-4、Claude 等),或自定义工具集——比如只允许读取代码而不允许执行。 - 完整的反馈循环:每次代码编辑后,Agent 会读取错误输出或测试结果,迭代修改直到通过。整个过程透明可追溯,所有交互日志都保存在本地。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 想用 LLM 自动化代码 BUG 修复的团队,需要 README 中的 Docker 环境(无需 GPU,但推荐 16GB+ RAM)。 - 研究 Agent 工具调用与规划的研究者,仓库提供了详细的论文复现脚本和评估数据集。 - 注意:目前主要面向 Python 代码库,且需要 GitHub 令牌(用于克隆仓库)和 OpenAI / Anthropic API Key。想立刻让 LLM 帮你修一个 Issue?直接访问仓库首页 SWE-agent,用 pip install sweagent 开始体验。别忘了先看 examp…

GitHub项目

Dify:拖拽搭建 AI 应用,RAG 与 Agent 工作流一站式平台

想快速把大模型接入业务,又不想从零写前后端和编排逻辑?Dify 提供了一个可视化的 AI 应用开发平台,支持 RAG 知识库、Agent 工具链、工作流编排,甚至一键发布为 API 或 Web 应用。无论是做客服机器人、文档问答还是自动化报告生成,它都能让开发者把精力放在 prompt 和逻辑上,而非基础设施。核心看点- 可视化编排:通过拖拽节点构建 AI 工作流,支持条件分支、循环、代码块,可串联 LLM 调用、知识检索、API 请求等,无需手写复杂逻辑。 - 内置 RAG 引擎:上传 PDF/网页/数据库,自动切片、向量化并建立索引,支持混合检索与重排序,直接提升问答准确率。 - 多模型与 Agent 支持:兼容 OpenAI、Claude、本地 Ollama 等数十种模型,Agent 可调用自定义工具(如搜索、计算器),通过 ReAct 模式自主决策。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁后端开发者、AI 应用产品经理、以及想快速验证 AI 想法的个人。部署依赖 Docker 和 PostgreSQL/Redis,社区版免费且开源(Apache-2.0 许可证)。如果不想自建,官方也提供云服务。从原型到生产,Dify 把 AI 应用开发的复杂度降了一个量级。去它的 GitHub 仓库 看示例视频和模板,你会发现原来搭个智能助手可以这么简单。

GitHub项目

让 LLM 学会联网搜索:Tavily 开源 RAG 工具链,精准抓取实时信息

当大模型遇到知识截止日期或需要查询最新新闻、股价、天气时,Tavily 提供了一套轻量级的 RAG 工具链,专为 LLM Agent 设计。它并非简单的搜索引擎包装,而是自动提取搜索结果中的关键段落、过滤广告、并返回结构化 JSON,让模型能直接消费。如果你在构建需要实时信息的聊天机器人或自动化决策系统,这个仓库能省去大量爬虫和文本清洗的脏活。核心看点- Agent 原生接口:输出为 {query, answer, results, response_time} 格式,可直接喂给 LangChain / LlamaIndex 的 Tool 节点,无需额外解析。 - 智能内容提取:自动从搜索结果中抽取最相关的 3-5 个段落,并附带来源 URL 与发布时间,减少模型幻觉。 - 可定制搜索源:支持限定域名(如 site:arxiv.org)、设置搜索深度(快速/深度模式),满足从简单问答到深度调研的不同场景。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 正在用 LangChain 或 AutoGPT 构建 Agent 的开发者,需要让 Agent 具备联网能力。 - 希望为内部知识库 RAG 系统补充实时外部信息的团队,避免模型回答过时。 - 对数据新鲜度有硬性要求的应用(如金融舆情监控、新闻摘要),Tavily 的深度模式会完整爬取页面正文。使用前需申请免费的 API Key(每日 1000 次调用),安装 pip install tavily-python 即可开始。更多高级用法(如自定义提取模板)见仓库的 Examples 文件夹。

GitHub项目

MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型

做 RAG 或拿本地文档微调时,最大的痛点往往是 PDF 排版乱、Word 表格识别难、图片里的文字还要另外 OCR。微软开源的 MarkItDown 把这一串流程收成一条命令:PDF、Word、Excel、PPT、图片、音视频都能转成干净的 Markdown,喂给大模型之前省掉大量手工清洗。特别适合正在搭知识库、做 Agent 数据预处理,或者只是想用 ChatGPT 分析本地文件的朋友。核心看点- 格式覆盖广:Office 三件套、PDF、EPUB、HTML 甚至带文字的视频、音频都能处理,图片可走 OCR 提取文字,算是给 LLM 准备的“万能转马克钉”。 - CLI 与库双形态:既能在终端一行命令转换,也能 from markitdown import MarkItDown 嵌入 Python 脚本,接进 RAG、Agent 的数据管线很顺。 - 扩展机制友好:自带 MarkdownConverter 基类,想接自己的 OCR、ASR 服务或私有解析器都可以,不用等官方更新。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁做 RAG 的知识库工程师、需要给大模型预处理文档的开发者,以及日常整理资料的信息工作者。Python 环境 3.10+ 即可,基础转换在本地完成不需要 GPU;若要用云端 OCR/ASR,可以在配置里接入 Azure 等服务,官网 README 有例子。许可证是 MIT,放心二开。如果你想看完整的支持列表和接入方式,直接翻 README 上的示例,比文档还直观。对了,项目最近还在更新,提 issue 也是有人管的。顺手去 MarkItDown 仓库 点个 Star 备用,下次同事让你解析脏文件时就能拿出来顶上了。

GitHub项目

Meta SAM 2:开源图像分割模型,物体追踪与视频遮罩一气呵成

搞计算机视觉的朋友肯定对 Meta 的 SAM 不陌生,现在它的升级版 SAM 2 来了。这个仓库把图像分割和视频对象追踪融合进了单一模型架构,你只需要点一下或画个框,就能在单帧上分割出物体,然后模型会自动追踪它在视频后续帧中的遮罩。对于需要精细处理视频素材的开发者、研究者来说,这意味着告别传统逐帧标注或分离的图像分割 + 追踪管线。核心看点- 统一图像与视频分割:不再需要两个独立模型。SAM 2 用同样的权重同时处理静态图和动态视频,输出像素级精确的遮罩。 - 交互式与自动模式双管齐下:你可以通过点击、框选或涂鸦给出提示,模型立即响应;也能配合 Grounding DINO 等文本检测器实现“用文字找物体并分割”。 - 推理高效,内存友好:基于 Transformer 的架构设计,对中等显卡(如 RTX 4090)就能流畅跑视频分割,官方提供了多种预训练权重和 ONNX 导出方案。仓库基于 Apache-2.0 许可证开放。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示典型场景包括视频编辑中的对象替换、医学影像病灶追踪、自动驾驶中动态障碍物的实例分割。你需要 Python 3.9+、PyTorch 2.0+,以及至少 16GB 显存的 GPU(建议 24GB 以上跑高清视频)。无需第三方 API Key,所有模型权重可直接从 Hugging Face 下载。安装指令和 Colab 示例都在 README 里写得很明白,半天内就能跑通第一个 demo。更多细节和社区讨论可以到仓库的 Discussions 里翻翻,不少人已经贴出了有趣的视频遮罩用例。如果你对 SAM 2 的实现原理或部署优化感兴趣,不妨直接看 README 中关于模型架构和训练数据的部分,链接在这里:meta sam 2 仓库主页。

GitHub项目

用思维链让本地小模型变聪明——COT 推理增强库 Thought 开源

当本地小模型面对复杂推理任务频频翻车时,Thought 提供了一种轻量级解决方案:通过结构化的思维链(Chain-of-Thought)提示编排,显著提升 7B-13B 参数模型的逻辑推理能力,而无需任何微调。它特别适合想在低算力环境下榨干模型潜力的开发者。核心看点- 零训练推理增强:无需 GPU 微调,仅通过动态构建思维链提示模板,即可在数学、常识推理等任务上看到 10-20% 的准确率提升,兼容 Ollama、llama.cpp 等主流推理后端。 - 多策略集成:内置 Zero-shot CoT、Self-Consistency、Tree-of-Thought 等多种推理策略,可通过配置文件一键切换,方便对比效果。 - 极简 Python API:三行代码即可对任意 Hugging Face 模型或 OpenAI 兼容 API 进行推理增强,并自动输出结构化推理过程与最终答案。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 依赖:Python 3.9+,仅需 pip install thought,无强制 GPU 要求。 - 典型场景:本地模型做数学题、逻辑问答、代码 bug 分析等需要多步推理的任务。 - 注意:思维链会增加 Token 消耗,对于上下文窗口较小的模型(如 2K)需适当缩短输入。项目以 MIT 许可证发布,README 提供了完整的策略对比表格和 Jupyter Notebook 示例。如果你正为小模型的推理能力发愁,不妨试试这个轻量级外挂——去 Thought 仓库 看看如何用一行代码开启思维链。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.