跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

用纯Go运行LLM?llama.go让你在CPU上本地跑大模型

如果你既想体验本地大模型推理,又不想被Python生态和GPU依赖绑住手脚,llama.go 是一个值得关注的选项。它用纯 Go 语言重写了 LLaMA 推理核心,无需 CUDA、PyTorch 或任何 Python 运行时,就能在 CPU 上加载并运行量化后的 LLaMA 系列模型,非常适合 Go 技术栈的开发者快速集成或二次开发。核心看点- 纯 Go 实现,零外部依赖:整个推理引擎仅依赖 Go 标准库和少量 C 代码(用于 mmap),编译后单二进制即可运行,部署极其轻量。 - 支持主流量化格式:可直接加载 GGUF 格式的量化模型(如 q4_0、q8_0),与 llama.cpp 生态兼容,无需额外转换工具。 - 交互式与 API 双模式:既提供命令行对话界面,也内置了兼容 OpenAI API 的 HTTP 服务端,方便接入已有应用。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁- Go 语言开发者:想在项目中嵌入本地推理能力,无需引入 Python 子进程或复杂环境。 - 边缘设备与资源受限场景:没有 GPU,但需要离线运行中小型模型(如 7B 参数量级)的推理任务。 - 学习推理原理的研究者:Go 代码结构清晰,适合阅读 LLaMA 推理的前向传播和 KV Cache 实现细节。如果你手头刚好有一台 CPU 机器,或者想探索 Go 在 AI 推理侧的潜力,不妨到 llama.go 仓库主页 下载 release 二进制试试看。项目采用 MIT 许可证,社区活跃度尚可,Issues 里也有不少实用的配置讨论。

GitHub项目

OpenVoice: 即时语音克隆,仅需短音频即可生成多语言语音

如果你在寻找一个能快速克隆任意说话人音色、并支持多语言语音生成的工具,OpenVoice 值得一试。由 myshell-ai 开源,它只需几秒的参考音频就能捕捉语音特征,并独立控制音色、情感与口音,非常适合语音合成、虚拟角色配音等场景。核心看点- 即时音色克隆:无需大量训练数据,上传一段短音频即可提取说话人特征,生成与目标音色高度一致的语音。 - 细粒度控制:可独立调节情感(如平静、快乐)和口音(如美式、英式),并支持跨语言(中、英、日、法等)合成。 - 轻量部署:基于 PyTorch,模型体积较小,在消费级 GPU(如 RTX 3090)上即可运行,并提供清晰的推理脚本。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示推荐使用 Python 3.8+ 和 PyTorch 1.13+,有 GPU 可大幅加速推理。无需外部 API Key,所有模型权重随仓库发布(遵循 MIT 许可证)。适合语音 AI 开发者、内容创作者和研究者快速集成语音克隆能力。更多细节与示例音频请查看仓库 README,动手试试你的第一个音色克隆:OpenVoice GitHub 仓库

GitHub项目

R1-V:用强化学习让VLM学会视觉定位,无需手工标注

想让视觉语言模型(VLM)不仅看懂图片,还能精准指出目标位置?R1-V 提供了一个极简的强化学习方案:基于 GRPO 算法,只靠“对与错”的奖励信号,就能让模型学会输出物体边界框。对于研究多模态对齐、Agent 视觉感知的开发者来说,这是一个低门槛的动手实验入口。核心看点- 纯强化学习实现视觉 grounding:无需人工标注的坐标回归数据,而是通过奖励模型判断“框是否包含目标物体”,驱动模型自己学会输出坐标。灵感来自 DeepSeek-R1 的推理范式。 - 代码极简,易于复现:基于 Qwen2-VL 等开源 VLM,训练脚本不到 200 行,依赖主流的 transformers、vLLM 和 TRL 库,适合快速跑通实验。 - 可扩展性强:支持替换不同的 VLM 基座和奖励函数定义,方便研究者探索“推理型视觉定位”的新范式。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁对多模态 Agent、视觉推理感兴趣的 AI 研究员或学生。需要至少一张 24GB 显存的 GPU(如 RTX 3090/4090)来微调 7B 级模型。无需外部 API Key,所有依赖均来自开源生态(Apache-2.0 许可)。想亲眼看看“零标注”的视觉定位如何工作?不妨从 README 的快速开始部分跑起,仓库地址:R1-V:用强化学习教会 VLM 看位置。

GitHub项目

用思维链让本地小模型变聪明——COT 推理增强库 Thought 开源

当本地小模型面对复杂推理任务频频翻车时,Thought 提供了一种轻量级解决方案:通过结构化的思维链(Chain-of-Thought)提示编排,显著提升 7B-13B 参数模型的逻辑推理能力,而无需任何微调。它特别适合想在低算力环境下榨干模型潜力的开发者。核心看点- 零训练推理增强:无需 GPU 微调,仅通过动态构建思维链提示模板,即可在数学、常识推理等任务上看到 10-20% 的准确率提升,兼容 Ollama、llama.cpp 等主流推理后端。 - 多策略集成:内置 Zero-shot CoT、Self-Consistency、Tree-of-Thought 等多种推理策略,可通过配置文件一键切换,方便对比效果。 - 极简 Python API:三行代码即可对任意 Hugging Face 模型或 OpenAI 兼容 API 进行推理增强,并自动输出结构化推理过程与最终答案。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 依赖:Python 3.9+,仅需 pip install thought,无强制 GPU 要求。 - 典型场景:本地模型做数学题、逻辑问答、代码 bug 分析等需要多步推理的任务。 - 注意:思维链会增加 Token 消耗,对于上下文窗口较小的模型(如 2K)需适当缩短输入。项目以 MIT 许可证发布,README 提供了完整的策略对比表格和 Jupyter Notebook 示例。如果你正为小模型的推理能力发愁,不妨试试这个轻量级外挂——去 Thought 仓库 看看如何用一行代码开启思维链。

GitHub项目

DeepSeek-Coder-V2:开源最强代码大模型,推理与生成双提升

如果你正在寻找一款在代码生成、推理和修复上能媲美甚至超越 GPT-4 的开源模型,DeepSeek-Coder-V2 值得立刻点开。它基于 MoE 架构,在 HumanEval、LiveCodeBench 等基准上表现亮眼,且支持 128K 上下文,非常适合处理复杂代码库或长程推理任务。无论是个人开发者还是团队,都能用它加速编码或搭建本地代码助手。核心看点- MoE 架构与超长上下文:采用混合专家模型,在保持高效推理的同时,支持 128K 上下文窗口,可一次性处理大型代码文件或跨文件依赖分析。 - 多语言与多任务覆盖:在 Python、Java、C++、JavaScript 等主流语言上表现优异,同时具备 代码生成、补全、修复和解释 能力,甚至能处理数学推理和通用问答。 - 开源权重与商业友好许可:模型权重以 Apache-2.0 许可证 发布,可自由用于商业项目,社区已有基于它构建的插件和工具链。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示推荐在 8GB 以上显存 的 GPU 上运行量化版本(如 4-bit),或直接通过 Hugging Face 的 Transformers 库加载。无需额外 API Key,下载权重即可本地部署。如果你更关注推理速度,可以配合 vLLM 或 llama.cpp 使用。想体验最新代码模型的能力边界?前往仓库查看模型卡、示例代码和社区贡献的部署方案,或许能直接解决你手头的编码难题。立即探索 DeepSeek-Coder-V2。

GitHub项目

Khoj:本地AI搜索你的知识库,比Obsidian自带搜索好用十倍

还在为记不清笔记放在哪个文件夹而抓狂?Khoj 能直接索引你本地的 Markdown、PDF、图片甚至代码,并用本地或云端的大模型给你精准答案。对 Obsidian、Logseq 用户来说,这几乎是知识管理的终局形态——安装一个插件,你的所有笔记瞬间拥有一个会思考的搜索引擎。核心看点- 多种数据源统一索引:支持本地文件、Obsidian 保险库、LaTeX、Org-mode 等,甚至能读取图片中的文字。索引后可通过自然语言提问,Khoj 会召回最相关片段并生成回答。 - 自由选择推理后端:既可以用 ChatGPT、Claude 等云端 API,也能全部在本地跑(通过 llama.cpp、Ollama),完全离线也能用。MIT 许可证,代码透明,隐私可控。 - 跨平台触手可及:桌面端有 Obsidian 插件、Emacs 包、Web 界面,移动端也有对应客户端。查询时还能一键跳到原始文件位置,非常顺手。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁- 笔记重度用户:如果你每天记大量笔记但检索低效,Khoj 能直接给出理解后的答案,而不是单纯的关键词匹配。 - 隐私敏感的研究者:选择本地模型,所有数据不出机器,适合处理敏感文档。 - 喜欢折腾的自部署玩家:通过 Docker 或 pip install khoj 就能跑起来,依赖 Python 3.10+ 和至少 8GB 内存。若用本地模型还需 GPU,但也可纯 CPU 推理(速度稍慢)。Khoj 的 README 写得相当详尽,从安装到自定义插件都有教程。如果你也想让自己的笔记“活”起来,不妨点开仓库看看:GitHub - khoj-ai/khoj

GitHub项目

SGLang:为 LLM 推理与结构化输出优化的高性能引擎

如果你正在为 LLM 的推理速度和结构化输出(JSON Schema、约束解码)头疼,SGLang 可能是你需要的加速器。它由 LMSYS 团队打造,专为 LLM 推理场景设计,通过一种称为“结构化生成语言”的编程模型,将提示预处理、并行采样和约束解码融合为一条高效流水线,特别适合需要高吞吐量的在线服务和 Agent 调用场景。核心看点- 结构化生成语言(SGLang):用 Python 子语言描述生成逻辑,自动优化执行计划,支持约束解码(如强制输出合法 JSON)和并行调用,大幅减少冗余计算。 - 高性能推理后端:集成了 FlashInfer 等优化内核,支持连续批处理、分页注意力,在多个基准测试中吞吐量优于 vLLM 和 TensorRT-LLM。 - 灵活的部署选项:提供 OpenAI 兼容的 API 服务器,也可作为 Python 库嵌入,支持 Llama、Mistral、Qwen 等主流模型。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示适合对推理延迟和吞吐量有要求的开发者,比如构建实时聊天机器人、Agent 工具链或结构化数据提取管道。需要 CUDA 环境(推荐 A100 或同等 GPU),Python 3.9+,模型权重需自行下载或从 Hugging Face 加载。项目采用 Apache-2.0 许可证,社区活跃,Issue 响应快。想体验“一次提示、多路并行输出”的威力?直接去 SGLang GitHub 仓库 看示例和性能对比。

GitHub项目

ChatTTS:开源语音合成黑马,自然对话级 TTS 引擎

如果你正在找一款能生成自然对话语气的 TTS,或者想为 AI 助手、播客内容配上更像真人的声音,ChatTTS 值得立刻关注。它专为对话场景设计,支持细粒度控制笑声、停顿、语气词,合成效果在自然度上明显优于传统拼接式或参数式 TTS,而且完全开源、可本地部署。核心看点- 对话级自然度:模型在大规模对话数据上训练,能自动生成“嗯”“啊”等语气词和恰当停顿,听感接近真人聊天。 - 细粒度控制:通过输入特定的音素标签或韵律标记,可精确调节语速、笑声强度、情感倾向,适合需要定制声音表现的场景。 - 轻量部署:模型权重约 1.5GB,支持 GPU 和 CPU 推理,Python 调用只需几行代码,也提供了 Gradio 交互界面。适合谁▲ github.com(阿里云通义万相生成配图,非网页截图)- 想做 AI 语音助手、有声读物或播客生成的内容创作者和开发者。 - 需要为虚拟角色、游戏 NPC 赋予自然声音的爱好者或小型团队。 - 对语音合成技术感兴趣,希望研究或微调 TTS 模型的研究者。使用前需在 Hugging Face 同意模型许可证并下载权重;推荐有 4GB+ 显存的 GPU 以获得实时推理速度。项目采用 MIT 许可证(但模型权重另有协议),社区活跃,Issue 区有大量调参技巧。直接去仓库体验在线 Demo 或看 README 的快速开始,也许你会立刻用它生成一条语音笔记:ChatTTS on GitHub

GitHub项目

Chrome 小模型也能跑 RAG:Surya 精准文档 OCR 与版面解析

如果你正头疼 PDF 表格、多栏排版、数学公式在 RAG 流水线中频频丢失语义,Surya 可能是你一直等的那个“文档理解”利器。这个开源项目专为复杂文档 OCR 与版面分析设计,能准确识别文本、表格、公式、页眉页脚,并输出结构化的 Markdown 或 JSON,让后续的检索与问答不再依赖“先转图片再瞎猜”的笨办法。核心看点- 精准版面解析:支持检测标题、段落、表格、图片、公式等 20+ 种区块,对多栏、手写混排、扫描件都有不错的鲁棒性,输出结构可直接喂给 RAG 分块逻辑。 - 轻量级 OCR 引擎:基于 Transformer 架构,不依赖云 API,单张 A100 或 RTX 4090 即可跑出高精度结果,Apache-2.0 许可证下可自由商用。 - 结构化输出与管线友好:能直接输出 Markdown(含表格、公式 LaTeX)、HTML 或带坐标的 JSON,方便与 LangChain、LlamaIndex 等框架集成,省去后处理脏活。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- RAG 应用开发者:需要将 PDF/扫描件拆成语义完整的文本块,Surya 的版面识别能大幅减少“表格被切碎”“公式变乱码”的痛点。 - 文档智能研究者:想快速获得高质量标注数据,或对比不同 OCR/版面分析模型效果。 - 需要本地部署的团队:模型权重约 1.5GB,单 GPU 即可推理,无需调用外部 API,数据安全可控。依赖 Python 3.9+、PyTorch,推荐至少 8GB 显存。无论你是想给 RAG 管线加个“文档理解”层,还是单纯需要比 Tesseract 更聪明的 OCR,Surya 都值得点进仓库细看 README 和在线 Demo。想体验完整能力,直接去 Surya GitHub 仓库 克隆运行,或看看作者提供的 Colab 笔记本。

GitHub项目

让 LLM 学会联网搜索:Tavily 开源 RAG 工具链,精准抓取实时信息

当大模型遇到知识截止日期或需要查询最新新闻、股价、天气时,Tavily 提供了一套轻量级的 RAG 工具链,专为 LLM Agent 设计。它并非简单的搜索引擎包装,而是自动提取搜索结果中的关键段落、过滤广告、并返回结构化 JSON,让模型能直接消费。如果你在构建需要实时信息的聊天机器人或自动化决策系统,这个仓库能省去大量爬虫和文本清洗的脏活。核心看点- Agent 原生接口:输出为 {query, answer, results, response_time} 格式,可直接喂给 LangChain / LlamaIndex 的 Tool 节点,无需额外解析。 - 智能内容提取:自动从搜索结果中抽取最相关的 3-5 个段落,并附带来源 URL 与发布时间,减少模型幻觉。 - 可定制搜索源:支持限定域名(如 site:arxiv.org)、设置搜索深度(快速/深度模式),满足从简单问答到深度调研的不同场景。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 正在用 LangChain 或 AutoGPT 构建 Agent 的开发者,需要让 Agent 具备联网能力。 - 希望为内部知识库 RAG 系统补充实时外部信息的团队,避免模型回答过时。 - 对数据新鲜度有硬性要求的应用(如金融舆情监控、新闻摘要),Tavily 的深度模式会完整爬取页面正文。使用前需申请免费的 API Key(每日 1000 次调用),安装 pip install tavily-python 即可开始。更多高级用法(如自定义提取模板)见仓库的 Examples 文件夹。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.