跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

LightRAG:把知识图谱塞进 RAG,检索又快又省 Token

做 RAG 的人大多踩过同一个坑:文档一多,检索要么召回不准,要么把大段原文硬塞进上下文,Token 烧得心疼。LightRAG 想解决的就是这件事——它把知识图谱的思路压进一套轻量实现里,让你用一台普通机器也能跑出「有关系、有层次」的检索效果。做企业知识库、文档问答、Agent 记忆层的开发者,值得点开看一眼。核心看点图结构与向量双路检索:既做实体关系抽取,也保留向量召回,问「谁和谁有关系」这类问题不再靠运气。增量更新:新文档进来可以只补增量,不必整库重建索引,日常维护成本低。接入门槛低:官方提供 Python SDK 与 API Server,能挂 Ollama 或 OpenAI 兼容接口,存储层可接 Neo4j、PostgreSQL 等,还配了 Web UI 方便先试手感。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示最省事的路径是先 pip 安装,指向一个本地或云端的模型服务跑一遍示例数据,再换成自己的文档。需要注意:实体抽取质量很大程度取决于你选了哪个 LLM,小模型跑出来的图会比较稀疏;仓库采用 MIT 许可证,商用相对宽松,但所依赖的模型权重与三方服务条款仍需以各自 LICENSE 为准。细节和最新改动建议直接看仓库 README 与 Releases,里面有完整配置项和示例脚本。去 LightRAG 仓库翻翻

GitHub项目

Wan2.2:MoE 架构的开源视频生成,本地也能跑起来

想在自己机器上做 AI 视频,却总被闭源 API 的排队和额度卡住?Wan2.2 把通义万相的视频生成权重、推理代码和 ComfyUI 玩法一起开源了,做短片、做概念验证的创作者,还有爱折腾本地模型的开发者,都可以直接上手。核心看点最先值得看的是 MoE 架构:把采样过程的高噪声与低噪声阶段交给不同的专家模型,画质和运动连贯性比前代更稳。仓库同时放出了文生视频、图生视频(A14B)和更轻量的 TI2V-5B,后者面向消费级显卡,显存压力友好不少。官方还给出 Hugging Face diffusers 与 ComfyUI 两条集成路径,社区工作流跟得很快,不是丢个权重就完事。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 NVIDIA GPU 和 Python 环境,权重从 Hugging Face 拉取,想省事可以直接照 README 里的 ComfyUI 流程走。注意模型权重有单独的使用条款,动手前先翻一遍仓库 LICENSE,商用场景以官方说明为准。README 里写了安装命令、显存参考和示例提示词,跑通第一条视频应该用不了太久。去 Wan2.2 仓库看看。

GitHub项目

FastMCP:把 Python 函数变成大模型能调用的 MCP 工具

工具函数写好了,想接进 Claude、Cursor 或自建的 LLM 客户端,还得再手写一层 JSON Schema 和路由——FastMCP 把这层胶水省掉了:给普通 Python 函数加个装饰器,它就成了模型能直接调用的 MCP 工具。正在做 Agent、想让本地脚本被大模型用起来的开发者可以直接点开看。核心看点- 装饰器即协议:@mcp.tool 会按类型注解自动生成参数说明,资源和提示词分别用 @mcp.resource、@mcp.prompt,不用手写 schema。 - stdio 与 HTTP 都能跑:本地直连桌面客户端,也能起 SSE 服务给远程或多客户端复用。 - 贴着 MCP 官方 Python SDK 走:客户端侧基本零改动,仓库提交和 Issue 都还活跃,跟得上协议演进。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示Python 3.10+ 即可,pip install fastmcp 后照着 README 起一个示例 server,纯 CPU 就够,不需要显卡,也不需要模型 API Key——它只负责把能力暴露出去,调不调由客户端决定。项目采用 Apache-2.0 许可,商用前建议按自身情况过一眼仓库 LICENSE。想接的第一个工具,就挑你每天在命令行里手敲的那条。README 里有完整示例和客户端配置片段,去 FastMCP 仓库 看两眼就能动手。

GitHub项目

Docling:把 PDF 转成 Markdown,RAG 前先跑一遍

做 RAG 的人大概都踩过同一个坑:模型换了一轮又一轮,结果卡住的原因却是 PDF 里那张跨页表格被抽成了乱码。Docling 就是冲着这件脏活来的文档解析库,适合正在搭知识库的开发者,也适合只想把论文、财报、扫描件转成 Markdown 的普通用户。核心看点- 版面结构尽量还原:双栏排版、标题层级、表格、公式、图片位置都试着保留下来,导出 Markdown、JSON 或 HTML,而不是吐一大坨没有顺序的纯文本。 - 本地跑得动:默认走本地模型推理,合同、病历这类不方便上传云端的文档可以离线处理。 - 接得上现有链路:解析结果能直接喂给常见的 RAG 框架和向量库,省掉自己写清洗脚本的时间。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示装好 Python 环境后 pip 安装即可,首次运行会自动下载版面分析和 OCR 相关的模型权重,CPU 能跑,有 GPU 会顺很多。命令行和 Python API 两种用法都有,批量处理一整个目录的 PDF 也不用写太多代码。许可证与模型权重条款以仓库内的 LICENSE 为准,商用前自己确认一遍。想先看效果,可以直接翻 README 里的示例输出,再对着 Releases 挑个版本装上试。仓库在这:docling:把 PDF 变成能喂给 RAG 的干净文本

GitHub项目

crawl4ai:把网页洗成 LLM 爱吃的 Markdown,RAG 不用手搓数据

做 RAG 最烦的往往不是模型,而是喂进去的网页又脏又碎:导航、广告、JS 渲染的内容混在一起,切完 chunk 全是噪声。crawl4ai 就是冲这件事来的——一个专门给 LLM 备料的开源爬虫,输出直接是干净 Markdown 和结构化 JSON。开发者、自建知识库的人、跑 Agent 的人都能少写一堆清洗代码。核心看点- 为 LLM 优化的输出:默认把页面转成 Markdown,保留标题层级、表格、代码块,也支持用 CSS/XPath 提取结构化字段,预处理量能省一大截。 - 不用从零手写爬虫:异步并发抓取,可接 Playwright 渲染 JS 页面,带会话、代理、去重和整站爬取模式。 - 能当数据摄取层:对上可以接主流 LLM 做内容过滤与抽取,对下能塞进 Agent 或 RAG 流程里补实时网页上下文。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁典型场景是自建知识库、资讯或竞品监控、给 Agent 补实时网页信息。依赖 Python 环境,需要浏览器渲染时用 crawl4ai-setup 装 Playwright;部分抽取能力要自备 API Key,也可以换本地模型。项目采用 Apache-2.0 许可,商用前建议以仓库 LICENSE 为准。想先试水,就跑 README 里那段最小示例抓一个页面,再去翻它的 Markdown 生成器和提取策略说明。去 crawl4ai 仓库翻一眼

GitHub项目

ktransformers:显存不够也能跑 DeepSeek MoE

想在本地跑 DeepSeek-R1 这类大 MoE,一看显存需求就被劝退——ktransformers 就是冲这个场景来的。它把稀疏专家权重放到 CPU 内存,把注意力等密集计算留给 GPU,让单卡甚至纯 CPU 的工作站也有机会把模型跑起来,适合想本地做私有部署的开发者与研究者。核心看点- CPU + GPU 异构推理:MoE 专家层卸载到内存,显存压力明显减小,手里显卡一般但内存够大就能试。 - 工程优化到位:算子基于 GGML/llama.cpp 生态,针对 x86 做了多线程、Intel AMX 等加速路径,也支持量化权重。 - 接口友好:自带风格接近 OpenAI 的本地服务端,接现成前端或 Agent 流程不用大改代码。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁典型场景是本地验证 MoE 大模型、做内网私有推理。需要 Python 环境和编译工具链,Windows 与 Linux 各有安装说明;模型权重体积不小,下载前先对照仓库里的兼容性表格,确认硬件与量化方案,权重与代码的许可条款以仓库 LICENSE 为准(代码为 Apache-2.0)。建议先翻 README 的支持列表再决定动不动手,安装踩坑与更新动态可以顺手关注 ktransformers。

GitHub项目

BitNet:把大模型压到 1-bit,CPU 上也能跑推理

想在本地跑大模型,先被显卡和内存劝退的人不少。microsoft/BitNet 走的是另一条路:把权重压到极低位宽,让不少推理负载直接落在 CPU 上。如果你做端侧部署、想省显存,或者单纯好奇低比特推理到底能跑成什么样,这个仓库值得点开看看。核心看点- 1-bit 权重推理:仓库里的 bitnet.cpp 面向三值/低比特量化模型,重点就是把推理从 GPU 往 CPU 上挪,显存压力小很多。 - 工具链相对完整:不只是论文配套代码,还包含量化与转换相关的脚本、构建说明和官方权重入口,自己拼流程的活儿少一些。 - MIT 许可,社区在动:issue 与 PR 里能看到持续的构建、性能与平台适配讨论,不是躺着不更新的仓库。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 Python 加 C++ 编译环境,Linux / Windows / macOS 都有对应构建说明;CPU 推理对内存仍有要求,模型权重得自己从 Hugging Face 下载。各权重页面的许可条款不完全相同,商用前请以仓库 LICENSE 与模型页面说明为准。想快速验证,先照着 README 的 quick start 走一遍最省事。真正想知道低比特推理跑起来是什么手感,建议直接去翻 README 里的构建步骤和性能说明,再顺手看下 Releases 有没有新的量化脚本。先去读一遍 BitNet 的 README

GitHub项目

Vanna:用大白话直查数据库,把 Text-to-SQL 做进你的应用

被业务拉着要报表又要反复改口径的开发者,很多时间其实消耗在写联表 SQL 上。Vanna 把“自然语言→SQL→结果回显”的完整链路收拢成一套 Python 框架,只需要准备你的数据库 schema 和少量样例,就能生成可解释的查询。它长期保持活跃提交,MIT 许可,想给团队搭一个内部查数助手的人会很对胃口。核心看点- 训练即 RAG,不碰微调:Vanna 先把 DDL、文档和几个示例问题做向量化,查询时找到最相关的表结构再交给 LLM 生成 SQL。换模型成本低,基础原理也好懂。 - 一接口连多种数据库:SQLite、PostgreSQL、Snowflake、BigQuery 等都有适配器,代码里切换数据库不用推翻重写,适合数仓环境不只一套的团队。 - 带展示界面也带 API:内置了一个轻量 Web 聊天页面,同时可以只调用 Vanna 的 Python 函数集成进现有程序;回答会附上 SQL 原文,方便核对与排查。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合被取数需求反复打扰的数据工程师,以及想快速落地一个可用的“企业查数机器人”的开发者。Vanna 本身不绑死某家模型,你只需要任一 OpenAI 兼容或 OpenRouter 的 API Key,想完全本地跑也可以接 Ollama 的兼容端点。安装走 pip 就好,但跑在敏感库上时最好给只读账号权限。整体思路比直接拿着大模型硬写要可控,多表关联场景尤其值得琢磨。想看看它如何设计训练集和连接器,直接去 Vanna 的 GitHub 主页 翻 README 和示例,比自己从零踩坑省时间。

GitHub项目

LlamaIndex:把文档变成 RAG 知识库的编排框架

想让大模型基于自己的私有资料回答,而不是临时翻聊天记录,LlamaIndex 是绕不开的选择之一。它不只帮你读取 PDF、维基和接口数据,把「切分—检索—合成」组织成可复用的模块,适合正在做 RAG 应用或者团队问答工具的人。核心看点给开发者最直观的几点物:多类型索引不只是向量库那一套,摘要索引、知识图谱索引等让不同问题有不同走法;统一数据接入内置几十种 loader,也能和 LangChain、LlamaHub 生态互相借力;高层 API + 可观测性用 query engine 几行代码出结果,回调机制能追踪每一步上下文来源。MIT 许可也让二次定制少些顾虑。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想快速验证 RAG 原型的调研者、做私有知识库的工程师、研究检索策略的人都能用得上。它是 Python 项目,本地装好依赖就能跑;底层模型默认接 OpenAI,也支持换本地推理端点,所以不一定需要 API Key,具体看选哪个 provider。如果觉得 README 入口太多,建议先挑 examples 里的 starter 跑一遍,再决定要不要碰更复杂的索引。动手前记得按仓库 LICENSE 确认自己的使用方式。LlamaIndex 的新思路和新模板更新很快,值得进去看两眼:打开 LlamaIndex

GitHub项目

TEN-Agent:把实时语音+视觉 Agent 装进自己的服务

搭一个能听、能看、能对话的 AI Agent,最烦人的往往不是模型本身,而是把音频流、STT、LLM、TTS 和摄像头输入手动串起来。TEN-Agent 把这套链路做成了可编排的实时多模态 Agent 运行时,适合想快速落地语音助手、智能终端或远程协作场景的开发者。核心看点- 实时多模态对话:支持语音、视频和文本输入同时进 Agent,自带打断与状态控制,不是简单的一问一答。 - 可视化 Agent Graph:用节点方式编排 STT、LLM、TTS 和业务逻辑,改一个分支不用推倒重写,调试时能直接看服务端消息流。 - 模块化后端与干净许可:ASR、LLM、TTS 都可替换接入,仓库以 Apache-2.0 开源,团队拿来改造商用心里比较有底。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示直接先看仓库里的 Playground 示例,按 README 配环境变量即可跑通一个基本对话 Agent。想体验完整语音链路,需要准备 ASR/TTS 或 RTC 厂商的 Key;如果只验证推理逻辑,先开文本模式更省事。文档和 issue 讨论都比较活跃,跟着官方示例比从零看协议更舒服。建议别只看 Readme 第一屏,花几分钟翻一遍 agents 目录和 Graph 示例,很多细节比教程讲得清楚:TEN-Agent 仓库

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.