跳到内容

下午好,继续加油,离目标更近一步。

GitHub项目

共 114 篇文章

GitHub项目

EmotiVoice:网易开源的中文情感语音合成,多音色带情绪

如果你在用TTS做有声内容、游戏配音或者虚拟助手,一定遇到过声音“没感情”的尴尬。网易有道开源的EmotiVoice直接瞄准这个痛点,一套模型能生成带有喜怒哀乐等多种情绪的中文语音,并且支持音色混合,开发者调个API就能集成。核心看点- 情感控制直观:通过提示词(如 happy、sad)或参考音频直接指定情绪强度,不像传统TTS只能靠调整语调参数盲猜。 - 多音色 + 方言支持:预训练模型覆盖常见中文口音和数十种音色,用少量数据就能暖启动新角色。 - 推理速度快:基于Transformer的流式架构,在消费级GPU上就能实时合成,项目用MIT许可,可免费用在商业项目里。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示适合需要高质量中文语音合成的游戏开发者、内容创作者以及做有声辅助功能的团队。建议用Python 3.9+,一块显存8G以上的N卡启动官方脚本;如果只想快速试听,Hugging Face上有在线Demo。自定义音色需要准备几段干净的人声素材。更多的技术细节、模型权重和微调脚本都在仓库里,点开 EmotiVoice on GitHub 可以直接体验。

GitHub项目

Quivr:用RAG打造你的第二大脑,私有知识库开源方案

如果你厌倦了把文档喂给ChatGPT后每次都要重复上传,或者担心数据隐私泄露,那Quivr值得你花两分钟看看。它是一个开源的“第二个大脑”,让你用本地或云端LLM构建私有RAG知识库,直接上传PDF、Markdown、代码文件甚至网页链接,就能像聊天一样检索内部信息。无论是个人笔记管理还是团队内部文档问答,都能用上。核心看点- 即插即用的RAG体验:内置文档解析、向量化存储与检索,支持Ollama、OpenAI等多种模型后端;无需手动写Embedding或向量库配置。 - 多模态输入与权限控制:不止文本,还可以拖入图片、音频(需模型支持),并提供简单的用户/群组权限,适合小团队协作。 - 数据完全自主可控:支持本地部署,用PostgreSQL + Supabase存储向量,无需把数据送进第三方SaaS,满足隐私偏好。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁知识工作者、研究人员、小团队,或任何想将散落文档按语义组织起来的人。依赖Docker、Node.js,可自托管;若使用本地Ollama无需API Key,若用OpenAI则需自己的Key。MIT许可证,放心商用。上手不难:克隆后执行docker compose up,浏览器打开后台,上传文档即开始问答。更详细的使用技巧可以看看仓库的README和官方文档,社区也在Discord里活跃答疑。快去Quivr仓库里点个Star,给你的知识库加个AI引擎吧。

GitHub项目

PydanticAI:用结构化思维开发 LLM Agent,开发者秒上手

厌倦了用大量 try-catch 和正则处理 LLM 的随机输出?Pydantic 团队推出了一款 Agent 框架,把结构化输出的优雅带进了 AI 应用开发。如果你是 Python 开发者,想快速构建可靠、带类型约束的对话或工具调用服务,这个项目值得你点开看看。核心看点类型安全贯穿全链路:依赖 Pydantic 模型的类型推断,你定义好响应结构,框架自动完成 JSON Schema 构造与输出校验,告别手动解析和 runtime 错误。 极简 Agent 循环:几行代码就能配置系统提示词、工具列表和模型(支持 OpenAI、Anthropic、Google 等主流闭源/开源模型),内置重试、流式与依赖注入,没有黑魔法。 生产级可观测:直接集成 Logfire(Pydantic 自家的可观测平台),也能接其他日志工具,每个请求的调用链一目了然,方便调试和监控。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁有 Python 基础、正在或打算用 LLM 做业务集成(客服、数据提取、自动化流程)的开发者。无需额外 API Key(自带模型接口),但如果你想用 GPT-4 或 Claude 等高阶模型,仍需要对应服务商 API。框架本身体积轻,仅依赖 httpx 和 Pydantic V2,本地跑个简单的 Agent 用 CPU 也足够。比较贴心的是,官方维护了一套直接可跑的示例(客服 Agent、RAG 检索、代码执行),从仓库的 README 里复制下来就能试。如果你正在踩坑 Agent 的状态管理和输出校验,去 PydanticAI 仓库 翻翻他们写的设计文档,很多设计理念能直接用到你自己的项目里。

GitHub项目

Letta:给 Agent 装上能自我更新的长期记忆

如果手头的 Agent 总在多轮对话后“失忆”,Letta 值得你点开源码看一眼。它是 MemGPT 的延续,把研究里的“自我编辑记忆”变成可自托管的 Agent 框架,非常适合正在做复杂助手、知识型 Bot 或长期任务的开发者。核心看点- 记忆即代码:上下文按 memory block 组织,Agent 可以通过工具调用自主写入、更新和清理记忆,而不是把所有历史都硬塞进 prompt。 - 开箱即用的运行时:带 REST API 和 Python SDK,配合官方 Server 就能本地跑起来,既接 OpenAI/Anthropic 这类云模型,也能对接本地推理服务。 - Apache-2.0 许可:可以放心自托管和二次开发,仓库近期提交与 Issues/PR 讨论都还算活跃,不是摆样子的空壳。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合被 context window 限制折磨的开发者和想研究 Agent 长期记忆机制的研究者。运行 Letta 需要准备好 Python 环境,服务端可以按 README 说明容器化部署;调用云模型要 API Key,用本地模型则参照你自己部署的推理服务即可。想理解 memory block 到底怎么工作,直接按 README 快速跑一个带记忆的 Agent;想聊架构取舍和后续方向,可以翻 Discussions。先从这个入口进:Letta 仓库

GitHub项目

Transformers.js:不用服务器,浏览器里直接跑大模型推理

如果你主要写前端,又想让页面里直接跑模型,这个库值得点开。transformers.js 把 Hugging Face 生态搬到浏览器和 Node.js,不用维护后端服务也能做文本生成、嵌入、分类、语音识别甚至图像分割。核心看点- ONNX Runtime 后端,模型经 Optimum 转换后能离线加载,支持 WebGPU 加速,特定模型在浏览器里能跑出可用的速度。 - API 对齐 Python 版 transformers,熟悉 transformers 的人可以很快迁移;也提供原生 JavaScript 的 Pipeline 接口。 - 覆盖面广,文本、视觉、音频、多模态任务都有示例,社区持续补充新模型。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁前端开发者、独立开发者,以及想给网页加 AI 能力但不想维护 GPU 服务器的团队。依赖 npm 包,模型权重由 Hugging Face Hub 分发,需注意各模型自身的许可证。推理时浏览器需要较新版本以启用 WebGPU,纯 CPU 也能跑,但速度依模型而定。可以先去 README 看支持模型列表,或到官方示例站试试实时效果,再按任务类型找对应 Pipeline。transformers.js 仓库主页 的 Releases 也常有新模型接入说明,值得关注。

GitHub项目

InternVL 视觉语言模型开源:多模态理解与图文对话还能本地跑

如果你正头疼怎么把大模型的能力扩展到图像理解上,又不想被封闭API绑死,那这个仓库值得你花三分钟看看。InternVL 是上海 AI Lab 开源的视觉语言模型系列,覆盖从 1B 到 40B 多种规模,支持图像描述、文档问答、图表分析等常见多模态任务,而且部署方案很接地气——单卡 RTX 3090 就能流畅运行轻量版。核心看点规模覆盖广,选择灵活:从 1B 的 Tiny(适合边缘设备)到 40B 的 V2,同一个权重仓库里按需切换,不需要东拼西凑。图文理解表现扎实:在 MMVP、MMMU 等权威基准上跟 GPT-4V 掰手腕,对中文场景也有专门优化,发票、海报、手写笔记的识别准确率很能打。推理工具链齐全:提供官方 Transformers 集成、vLLM 后端支持,还附带简洁的 Gradio 交互界面,拿来就测,不用二次封装。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示典型玩法是用 transformers 加载模型做零样本问答,或者部署成 API 给其他应用调用。依赖主要是 PyTorch、transformers、accelerate,建议用 CUDA 11.8+ 的 GPU。轻量版本(InternVL-Chat-V1.1-1B)在 6GB 显存就能完成推理,适合个人开发者或小团队快速验证多模态场景。模型权重遵循 Apache-2.0 许可证,商用前建议核对具体版本声明。想试试多模态能力或者给你的 RAG 系统加上图片理解?直接去仓库 README 看模型卡和快速启动脚本,两行命令就能跑出第一张图的回答。项目地址:InternVL 开源仓库

GitHub项目

DSPy 让大模型提示词工程变可编程,告别手写 Prompt 碎片

还在为几十条 Prompt 维护头疼?试试斯坦福开源的 DSPy——它把「提示词工程」抽象成类似 PyTorch 的声明式模块,用优化器自动调整 Prompt 与权重,而不是靠人肉调词。适合做 RAG、Agent 或多步推理管线的研究者与工程师,能明显减少调试咒语的痛苦。核心看点- 模块化声明式 API:用 dspy.ChainOfThought、dspy.ReAct 等封装推理步骤,用代码组织复杂流程,Prompt 不再散落各处。 - 自动优化器:内置 BootstrapFewShot、MIPRO 等编译器,能从少量示例中自动生成高质量 few-shot 与指令,效果常优于手动设计。 - 多后端兼容:支持 OpenAI、Anthropic、Cohere 以及本地模型(通过 Ollama 等),同一套代码可切换不同 LM,方便对比。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁如果你正在做 RAG 问答、Agent 工具调用或多跳检索,且对结果一致性有要求,DSPy 很值得一试。依赖主要是 Python 与一个可用的 LLM 接口;若用本地模型,需要提前跑起 OpenAI 兼容服务。项目以 MIT 许可发布,社区活跃,文档里有大量示例 Notebook。想快速感受「写 Python 替代拼 Prompt」的体验,直接去看看 DSPy 的 README 与示例,很多模式直接抄就能用。

GitHub项目

MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型

做 RAG 或拿本地文档微调时,最大的痛点往往是 PDF 排版乱、Word 表格识别难、图片里的文字还要另外 OCR。微软开源的 MarkItDown 把这一串流程收成一条命令:PDF、Word、Excel、PPT、图片、音视频都能转成干净的 Markdown,喂给大模型之前省掉大量手工清洗。特别适合正在搭知识库、做 Agent 数据预处理,或者只是想用 ChatGPT 分析本地文件的朋友。核心看点- 格式覆盖广:Office 三件套、PDF、EPUB、HTML 甚至带文字的视频、音频都能处理,图片可走 OCR 提取文字,算是给 LLM 准备的“万能转马克钉”。 - CLI 与库双形态:既能在终端一行命令转换,也能 from markitdown import MarkItDown 嵌入 Python 脚本,接进 RAG、Agent 的数据管线很顺。 - 扩展机制友好:自带 MarkdownConverter 基类,想接自己的 OCR、ASR 服务或私有解析器都可以,不用等官方更新。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁做 RAG 的知识库工程师、需要给大模型预处理文档的开发者,以及日常整理资料的信息工作者。Python 环境 3.10+ 即可,基础转换在本地完成不需要 GPU;若要用云端 OCR/ASR,可以在配置里接入 Azure 等服务,官网 README 有例子。许可证是 MIT,放心二开。如果你想看完整的支持列表和接入方式,直接翻 README 上的示例,比文档还直观。对了,项目最近还在更新,提 issue 也是有人管的。顺手去 MarkItDown 仓库 点个 Star 备用,下次同事让你解析脏文件时就能拿出来顶上了。

GitHub项目

LitGPT:用PyTorch原生方式训练部署LLM,告别框架黑盒

如果你是那种觉得Hugging Face Trainer太黑箱、想自己掌控每一行训练代码的开发者,LitGPT可能是你一直想要的东西。它不是又一个高层封装,而是基于PyTorch Lightning构建的轻量级LLM训练与推理工具,直接暴露模型架构和优化步骤,同时省去重复的模板代码。无论是从头预训练、LoRA微调,还是部署,都用一套熟悉的PyTorch风格搞定,适合喜欢「看得见」训练过程的科研人员和工程师。核心看点- 透明可控的训练流程:使用PyTorch Lightning的LightningModule和LightningDataModule,hparams和checkpoints都按标准结构组织,没有隐式全局变量。支持FSDP、混合精度、梯度检查点等主流优化,配置通过YAML或CLI指定,极易复现实验。 - 原生支持多种模型架构:包括Llama 2、Mistral、Mixtral、Phi-2、Gemma、Qwen等,权重可直接从Hugging Face Hub下载,无需转换。微调支持LoRA/QLoRA、Adapter,且提供最小代码量的脚本,例如finetune/lora.py只有不到200行,适合学习和定制。 - 推理与导出一体化:能在单卡或CPU上跑生成,也支持批量推理;导出为torch.compile、ONNX或Triton推理服务所需格式,部署链路清晰。作者还提供量化方案,方便在边缘设备上运行。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁- 研究者:需要修改模型内部结构、试验新训练策略,LitGPT的模块化设计让你不必重写整套流程。工程师:需要一个可读性强、易于集成到现有CI/CD管线的LLM开发工具,且不想引入太多黑盒依赖。依赖:需要PyTorch 2.1+,CUDA或MPS加速;微调一张A100 80GB可跑7B模型,如果你的显…

GitHub项目

ms-swift:一条命令微调全模态大模型,LoRA 和 DeepSpeed 都搞定

微调一个开源模型,光是环境适配、数据格式化、多卡并行就够劝退一半人。ms-swift 把这一整套流程收敛为命令行工具,适合想快速验证直觉的算法工程师和研究者。核心看点- 全模态覆盖:除了常规 LLM,也支持视觉、语音等多模态模型的微调、推理与导出,省掉四处找轮子的时间。 - 训练配置开箱即用:内置 LoRA、QLoRA、全参微调以及 DeepSpeed 策略,能直接套用现成脚本,日志清晰,调试相对省心。 - 生态丰富:兼容多种模型格式与数据集来源,自动下载模型权重,社区活跃,踩坑记录容易搜到。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁有基础 GPU 环境、想做模型微调或风格定制,但不想从零搭建训练链路的人。普通开发者可以用小模型先跑通 demo;研究者也能方便复现对比实验。不需要 API Key。项目采用 Apache-2.0 许可证,模型权重使用时以各模型本身许可为准。如果你正在比较不同微调框架,建议直接打开ms-swift 的 README 查看支持矩阵与快速上手命令,文档里还附了常见任务示例。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.