跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

InternVL 视觉语言模型开源:多模态理解与图文对话还能本地跑

如果你正头疼怎么把大模型的能力扩展到图像理解上,又不想被封闭API绑死,那这个仓库值得你花三分钟看看。InternVL 是上海 AI Lab 开源的视觉语言模型系列,覆盖从 1B 到 40B 多种规模,支持图像描述、文档问答、图表分析等常见多模态任务,而且部署方案很接地气——单卡 RTX 3090 就能流畅运行轻量版。核心看点规模覆盖广,选择灵活:从 1B 的 Tiny(适合边缘设备)到 40B 的 V2,同一个权重仓库里按需切换,不需要东拼西凑。图文理解表现扎实:在 MMVP、MMMU 等权威基准上跟 GPT-4V 掰手腕,对中文场景也有专门优化,发票、海报、手写笔记的识别准确率很能打。推理工具链齐全:提供官方 Transformers 集成、vLLM 后端支持,还附带简洁的 Gradio 交互界面,拿来就测,不用二次封装。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示典型玩法是用 transformers 加载模型做零样本问答,或者部署成 API 给其他应用调用。依赖主要是 PyTorch、transformers、accelerate,建议用 CUDA 11.8+ 的 GPU。轻量版本(InternVL-Chat-V1.1-1B)在 6GB 显存就能完成推理,适合个人开发者或小团队快速验证多模态场景。模型权重遵循 Apache-2.0 许可证,商用前建议核对具体版本声明。想试试多模态能力或者给你的 RAG 系统加上图片理解?直接去仓库 README 看模型卡和快速启动脚本,两行命令就能跑出第一张图的回答。项目地址:InternVL 开源仓库

GitHub项目

OpenAI Swarm:轻量多Agent框架,几百行代码搞定协作编排

你在为多Agent之间的消息路由和工具调用头疼吗?OpenAI 刚开源的 Swarm 直接抛出了一个极简方案——不依赖 LangChain 那种厚重的抽象层,只用函数调用和循环队列让 Agent 互相“对话”,整个核心不到 300 行 Python。如果你平时折腾 Agent 编排、想快速验证多角色协作场景,这个仓库值得点开细看。核心看点- 极简API:Agent 就是一个 dict + 一个函数列表,通过 run() 启动后自动处理上下文切换和工具调用,新手也能半小时跑起来第一个多Agent流程。 - 无外部依赖:只要 Python 3.10+ 和 OpenAI SDK,无需 Redis、数据库或额外中间件,本地就能复现 ChatGPT 那样的多轮对话调度。 - 可扩展性:支持函数注册、Agent 间函数传递(handoff),你能用几行代码实现“质检员→修正员→审核员”的流水线,适合做 AIGC 内容审核或客服分流。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示项目采用 MIT 许可证,直接 pip install swarm 或克隆仓库就能用。典型场景是快速原型验证:比如让一个 Agent 阅读文档并提取摘要,再传给另一个 Agent 生成报告。需要 OpenAI API Key 才能调用实际模型,但仓库自带了模拟测试接口,不联网也能体验核心逻辑。GPU 不是必须的,完全依赖云 API。想看看怎么用 5 个函数定义出一组助手团队?赶紧去仓库的 README 和示例目录翻翻,那里有完整的旅游预订、客户支持等现成例子。仓库地址:OpenAI Swarm on GitHub

GitHub项目

OpenHands 开源 AI 程序员:Agent 能自己改代码

你是不是也烦透了“AI 只会聊天,但不会干活”?OpenHands 把大模型接进沙箱环境,让 Agent 真正读仓库、写代码、跑命令,而不是只给建议。最适合想用 AI 处理真实 GitHub issue 的开发者。核心看点- 端到端处理 issue:丢给它一个 bug 描述,它会自动分析代码结构、修改文件并执行测试,把活干完。 - 能操作终端和浏览器:不只是改代码,还能运行调试命令、打开网页复现问题,覆盖完整开发闭环。 - 模型自由切换:可以接 OpenAI、Anthropic,也能连本地 Ollama,MIT 许可证让二次开发没负担。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示个人开发者可以把它当作结对编程伙伴;研究者也能用它做 Agent 行为实验。需要 Python 3.11 及以上,推荐 16GB 内存;只想体验的话有在线 demo,跑复杂任务再考虑接入 API Key。想看看它怎么把一个“一句话需求”变成可运行的 PR?直接去 README 翻 demo 视频和架构图,有问题去 Issues 里聊:OpenHands

GitHub项目

LitGPT:用PyTorch原生方式训练部署LLM,告别框架黑盒

如果你是那种觉得Hugging Face Trainer太黑箱、想自己掌控每一行训练代码的开发者,LitGPT可能是你一直想要的东西。它不是又一个高层封装,而是基于PyTorch Lightning构建的轻量级LLM训练与推理工具,直接暴露模型架构和优化步骤,同时省去重复的模板代码。无论是从头预训练、LoRA微调,还是部署,都用一套熟悉的PyTorch风格搞定,适合喜欢「看得见」训练过程的科研人员和工程师。核心看点- 透明可控的训练流程:使用PyTorch Lightning的LightningModule和LightningDataModule,hparams和checkpoints都按标准结构组织,没有隐式全局变量。支持FSDP、混合精度、梯度检查点等主流优化,配置通过YAML或CLI指定,极易复现实验。 - 原生支持多种模型架构:包括Llama 2、Mistral、Mixtral、Phi-2、Gemma、Qwen等,权重可直接从Hugging Face Hub下载,无需转换。微调支持LoRA/QLoRA、Adapter,且提供最小代码量的脚本,例如finetune/lora.py只有不到200行,适合学习和定制。 - 推理与导出一体化:能在单卡或CPU上跑生成,也支持批量推理;导出为torch.compile、ONNX或Triton推理服务所需格式,部署链路清晰。作者还提供量化方案,方便在边缘设备上运行。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁- 研究者:需要修改模型内部结构、试验新训练策略,LitGPT的模块化设计让你不必重写整套流程。工程师:需要一个可读性强、易于集成到现有CI/CD管线的LLM开发工具,且不想引入太多黑盒依赖。依赖:需要PyTorch 2.1+,CUDA或MPS加速;微调一张A100 80GB可跑7B模型,如果你的显…

GitHub项目

PydanticAI:用结构化思维开发 LLM Agent,开发者秒上手

厌倦了用大量 try-catch 和正则处理 LLM 的随机输出?Pydantic 团队推出了一款 Agent 框架,把结构化输出的优雅带进了 AI 应用开发。如果你是 Python 开发者,想快速构建可靠、带类型约束的对话或工具调用服务,这个项目值得你点开看看。核心看点类型安全贯穿全链路:依赖 Pydantic 模型的类型推断,你定义好响应结构,框架自动完成 JSON Schema 构造与输出校验,告别手动解析和 runtime 错误。 极简 Agent 循环:几行代码就能配置系统提示词、工具列表和模型(支持 OpenAI、Anthropic、Google 等主流闭源/开源模型),内置重试、流式与依赖注入,没有黑魔法。 生产级可观测:直接集成 Logfire(Pydantic 自家的可观测平台),也能接其他日志工具,每个请求的调用链一目了然,方便调试和监控。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁有 Python 基础、正在或打算用 LLM 做业务集成(客服、数据提取、自动化流程)的开发者。无需额外 API Key(自带模型接口),但如果你想用 GPT-4 或 Claude 等高阶模型,仍需要对应服务商 API。框架本身体积轻,仅依赖 httpx 和 Pydantic V2,本地跑个简单的 Agent 用 CPU 也足够。比较贴心的是,官方维护了一套直接可跑的示例(客服 Agent、RAG 检索、代码执行),从仓库的 README 里复制下来就能试。如果你正在踩坑 Agent 的状态管理和输出校验,去 PydanticAI 仓库 翻翻他们写的设计文档,很多设计理念能直接用到你自己的项目里。

GitHub项目

Letta:给 Agent 装上能自我更新的长期记忆

如果手头的 Agent 总在多轮对话后“失忆”,Letta 值得你点开源码看一眼。它是 MemGPT 的延续,把研究里的“自我编辑记忆”变成可自托管的 Agent 框架,非常适合正在做复杂助手、知识型 Bot 或长期任务的开发者。核心看点- 记忆即代码:上下文按 memory block 组织,Agent 可以通过工具调用自主写入、更新和清理记忆,而不是把所有历史都硬塞进 prompt。 - 开箱即用的运行时:带 REST API 和 Python SDK,配合官方 Server 就能本地跑起来,既接 OpenAI/Anthropic 这类云模型,也能对接本地推理服务。 - Apache-2.0 许可:可以放心自托管和二次开发,仓库近期提交与 Issues/PR 讨论都还算活跃,不是摆样子的空壳。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合被 context window 限制折磨的开发者和想研究 Agent 长期记忆机制的研究者。运行 Letta 需要准备好 Python 环境,服务端可以按 README 说明容器化部署;调用云模型要 API Key,用本地模型则参照你自己部署的推理服务即可。想理解 memory block 到底怎么工作,直接按 README 快速跑一个带记忆的 Agent;想聊架构取舍和后续方向,可以翻 Discussions。先从这个入口进:Letta 仓库

GitHub项目

ms-swift:一条命令微调全模态大模型,LoRA 和 DeepSpeed 都搞定

微调一个开源模型,光是环境适配、数据格式化、多卡并行就够劝退一半人。ms-swift 把这一整套流程收敛为命令行工具,适合想快速验证直觉的算法工程师和研究者。核心看点- 全模态覆盖:除了常规 LLM,也支持视觉、语音等多模态模型的微调、推理与导出,省掉四处找轮子的时间。 - 训练配置开箱即用:内置 LoRA、QLoRA、全参微调以及 DeepSpeed 策略,能直接套用现成脚本,日志清晰,调试相对省心。 - 生态丰富:兼容多种模型格式与数据集来源,自动下载模型权重,社区活跃,踩坑记录容易搜到。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁有基础 GPU 环境、想做模型微调或风格定制,但不想从零搭建训练链路的人。普通开发者可以用小模型先跑通 demo;研究者也能方便复现对比实验。不需要 API Key。项目采用 Apache-2.0 许可证,模型权重使用时以各模型本身许可为准。如果你正在比较不同微调框架,建议直接打开ms-swift 的 README 查看支持矩阵与快速上手命令,文档里还附了常见任务示例。

GitHub项目

想用自然语言写脚本?gptscript 让 AI 直接调度 API 与工具

写脚本时常常要查文档、拼参数,gptscript 想改变这件事:用一段自然语言描述你要做什么,它就能自动调用大模型来拆解任务、执行 API 调用和本地工具。对开发者来说,这意味着可以把日常自动化、数据查询、甚至 CI/CD 流程写成可读的“描述”,而不是堆代码。仓库采用 Apache-2.0 许可,README 清晰地列出了安装、运行和自定义工具链的步骤,最近还在持续加新功能和修复 issue。核心看点- 自然语言驱动:只要用英文描述目标(比如“下载最近 10 条 GitHub Release 信息并汇总成邮件”),gptscript 就会自动规划步骤、调用内置或自定义的工具完成,不需要手写 curl 或 Python 胶水。 - 可扩展的工具生态:支持接入任意 HTTP API、脚本、甚至第三方 Agent,开发者可以把自己的本地命令或微服务注册为 gptscript 的“工具”,复用性很强。 - 运行透明可调试:命令行模式下会打印每一步的推理过程和工具调用详情,方便你理解它到底做了什么,也方便修正 prompt 或工具描述。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁后端/DevOps 开发者、AI 应用原型师,以及任何希望通过自然语言快速编写自动化脚本的人。依赖很简单:只需要一个 Python 3.10+ 环境,以及一个 OpenAI API Key(或兼容接口),无需 GPU。第一次试用可参考仓库里给的“5 分钟快速开始”示例。用 gptscript 写脚本就像跟同事交代任务——试试看修改描述里的措辞,还能得到完全不同的执行路径。详细用法和工具注册方法都在 gptscript 官方仓库的 README 里,值得花几分钟翻一翻。

GitHub项目

MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型

做 RAG 或拿本地文档微调时,最大的痛点往往是 PDF 排版乱、Word 表格识别难、图片里的文字还要另外 OCR。微软开源的 MarkItDown 把这一串流程收成一条命令:PDF、Word、Excel、PPT、图片、音视频都能转成干净的 Markdown,喂给大模型之前省掉大量手工清洗。特别适合正在搭知识库、做 Agent 数据预处理,或者只是想用 ChatGPT 分析本地文件的朋友。核心看点- 格式覆盖广:Office 三件套、PDF、EPUB、HTML 甚至带文字的视频、音频都能处理,图片可走 OCR 提取文字,算是给 LLM 准备的“万能转马克钉”。 - CLI 与库双形态:既能在终端一行命令转换,也能 from markitdown import MarkItDown 嵌入 Python 脚本,接进 RAG、Agent 的数据管线很顺。 - 扩展机制友好:自带 MarkdownConverter 基类,想接自己的 OCR、ASR 服务或私有解析器都可以,不用等官方更新。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁做 RAG 的知识库工程师、需要给大模型预处理文档的开发者,以及日常整理资料的信息工作者。Python 环境 3.10+ 即可,基础转换在本地完成不需要 GPU;若要用云端 OCR/ASR,可以在配置里接入 Azure 等服务,官网 README 有例子。许可证是 MIT,放心二开。如果你想看完整的支持列表和接入方式,直接翻 README 上的示例,比文档还直观。对了,项目最近还在更新,提 issue 也是有人管的。顺手去 MarkItDown 仓库 点个 Star 备用,下次同事让你解析脏文件时就能拿出来顶上了。

GitHub项目

Quivr:用RAG打造你的第二大脑,私有知识库开源方案

如果你厌倦了把文档喂给ChatGPT后每次都要重复上传,或者担心数据隐私泄露,那Quivr值得你花两分钟看看。它是一个开源的“第二个大脑”,让你用本地或云端LLM构建私有RAG知识库,直接上传PDF、Markdown、代码文件甚至网页链接,就能像聊天一样检索内部信息。无论是个人笔记管理还是团队内部文档问答,都能用上。核心看点- 即插即用的RAG体验:内置文档解析、向量化存储与检索,支持Ollama、OpenAI等多种模型后端;无需手动写Embedding或向量库配置。 - 多模态输入与权限控制:不止文本,还可以拖入图片、音频(需模型支持),并提供简单的用户/群组权限,适合小团队协作。 - 数据完全自主可控:支持本地部署,用PostgreSQL + Supabase存储向量,无需把数据送进第三方SaaS,满足隐私偏好。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁知识工作者、研究人员、小团队,或任何想将散落文档按语义组织起来的人。依赖Docker、Node.js,可自托管;若使用本地Ollama无需API Key,若用OpenAI则需自己的Key。MIT许可证,放心商用。上手不难:克隆后执行docker compose up,浏览器打开后台,上传文档即开始问答。更详细的使用技巧可以看看仓库的README和官方文档,社区也在Discord里活跃答疑。快去Quivr仓库里点个Star,给你的知识库加个AI引擎吧。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.