Translating this page to English in your browser…
跳到内容

早上好,祝你今天高效顺利。

GitHub项目

共 137 篇文章

GitHub项目
最新

FastMCP:把 Python 函数变成大模型能调用的 MCP 工具

工具函数写好了,想接进 Claude、Cursor 或自建的 LLM 客户端,还得再手写一层 JSON Schema 和路由——FastMCP 把这层胶水省掉了:给普通 Python 函数加个装饰器,它就成了模型能直接调用的 MCP 工具。正在做 Agent、想让本地脚本被大模型用起来的开发者可以直接点开看。核心看点- 装饰器即协议:@mcp.tool 会按类型注解自动生成参数说明,资源和提示词分别用 @mcp.resource、@mcp.prompt,不用手写 schema。 - stdio 与 HTTP 都能跑:本地直连桌面客户端,也能起 SSE 服务给远程或多客户端复用。 - 贴着 MCP 官方 Python SDK 走:客户端侧基本零改动,仓库提交和 Issue 都还活跃,跟得上协议演进。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示Python 3.10+ 即可,pip install fastmcp 后照着 README 起一个示例 server,纯 CPU 就够,不需要显卡,也不需要模型 API Key——它只负责把能力暴露出去,调不调由客户端决定。项目采用 Apache-2.0 许可,商用前建议按自身情况过一眼仓库 LICENSE。想接的第一个工具,就挑你每天在命令行里手敲的那条。README 里有完整示例和客户端配置片段,去 FastMCP 仓库 看两眼就能动手。

GitHub项目
最新

Docling:把 PDF 转成 Markdown,RAG 前先跑一遍

做 RAG 的人大概都踩过同一个坑:模型换了一轮又一轮,结果卡住的原因却是 PDF 里那张跨页表格被抽成了乱码。Docling 就是冲着这件脏活来的文档解析库,适合正在搭知识库的开发者,也适合只想把论文、财报、扫描件转成 Markdown 的普通用户。核心看点- 版面结构尽量还原:双栏排版、标题层级、表格、公式、图片位置都试着保留下来,导出 Markdown、JSON 或 HTML,而不是吐一大坨没有顺序的纯文本。 - 本地跑得动:默认走本地模型推理,合同、病历这类不方便上传云端的文档可以离线处理。 - 接得上现有链路:解析结果能直接喂给常见的 RAG 框架和向量库,省掉自己写清洗脚本的时间。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示装好 Python 环境后 pip 安装即可,首次运行会自动下载版面分析和 OCR 相关的模型权重,CPU 能跑,有 GPU 会顺很多。命令行和 Python API 两种用法都有,批量处理一整个目录的 PDF 也不用写太多代码。许可证与模型权重条款以仓库内的 LICENSE 为准,商用前自己确认一遍。想先看效果,可以直接翻 README 里的示例输出,再对着 Releases 挑个版本装上试。仓库在这:docling:把 PDF 变成能喂给 RAG 的干净文本

GitHub项目
最新

crawl4ai:把网页洗成 LLM 爱吃的 Markdown,RAG 不用手搓数据

做 RAG 最烦的往往不是模型,而是喂进去的网页又脏又碎:导航、广告、JS 渲染的内容混在一起,切完 chunk 全是噪声。crawl4ai 就是冲这件事来的——一个专门给 LLM 备料的开源爬虫,输出直接是干净 Markdown 和结构化 JSON。开发者、自建知识库的人、跑 Agent 的人都能少写一堆清洗代码。核心看点- 为 LLM 优化的输出:默认把页面转成 Markdown,保留标题层级、表格、代码块,也支持用 CSS/XPath 提取结构化字段,预处理量能省一大截。 - 不用从零手写爬虫:异步并发抓取,可接 Playwright 渲染 JS 页面,带会话、代理、去重和整站爬取模式。 - 能当数据摄取层:对上可以接主流 LLM 做内容过滤与抽取,对下能塞进 Agent 或 RAG 流程里补实时网页上下文。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁典型场景是自建知识库、资讯或竞品监控、给 Agent 补实时网页信息。依赖 Python 环境,需要浏览器渲染时用 crawl4ai-setup 装 Playwright;部分抽取能力要自备 API Key,也可以换本地模型。项目采用 Apache-2.0 许可,商用前建议以仓库 LICENSE 为准。想先试水,就跑 README 里那段最小示例抓一个页面,再去翻它的 Markdown 生成器和提取策略说明。去 crawl4ai 仓库翻一眼

GitHub项目

ktransformers:显存不够也能跑 DeepSeek MoE

想在本地跑 DeepSeek-R1 这类大 MoE,一看显存需求就被劝退——ktransformers 就是冲这个场景来的。它把稀疏专家权重放到 CPU 内存,把注意力等密集计算留给 GPU,让单卡甚至纯 CPU 的工作站也有机会把模型跑起来,适合想本地做私有部署的开发者与研究者。核心看点- CPU + GPU 异构推理:MoE 专家层卸载到内存,显存压力明显减小,手里显卡一般但内存够大就能试。 - 工程优化到位:算子基于 GGML/llama.cpp 生态,针对 x86 做了多线程、Intel AMX 等加速路径,也支持量化权重。 - 接口友好:自带风格接近 OpenAI 的本地服务端,接现成前端或 Agent 流程不用大改代码。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁典型场景是本地验证 MoE 大模型、做内网私有推理。需要 Python 环境和编译工具链,Windows 与 Linux 各有安装说明;模型权重体积不小,下载前先对照仓库里的兼容性表格,确认硬件与量化方案,权重与代码的许可条款以仓库 LICENSE 为准(代码为 Apache-2.0)。建议先翻 README 的支持列表再决定动不动手,安装踩坑与更新动态可以顺手关注 ktransformers。

GitHub项目

BitNet:把大模型压到 1-bit,CPU 上也能跑推理

想在本地跑大模型,先被显卡和内存劝退的人不少。microsoft/BitNet 走的是另一条路:把权重压到极低位宽,让不少推理负载直接落在 CPU 上。如果你做端侧部署、想省显存,或者单纯好奇低比特推理到底能跑成什么样,这个仓库值得点开看看。核心看点- 1-bit 权重推理:仓库里的 bitnet.cpp 面向三值/低比特量化模型,重点就是把推理从 GPU 往 CPU 上挪,显存压力小很多。 - 工具链相对完整:不只是论文配套代码,还包含量化与转换相关的脚本、构建说明和官方权重入口,自己拼流程的活儿少一些。 - MIT 许可,社区在动:issue 与 PR 里能看到持续的构建、性能与平台适配讨论,不是躺着不更新的仓库。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 Python 加 C++ 编译环境,Linux / Windows / macOS 都有对应构建说明;CPU 推理对内存仍有要求,模型权重得自己从 Hugging Face 下载。各权重页面的许可条款不完全相同,商用前请以仓库 LICENSE 与模型页面说明为准。想快速验证,先照着 README 的 quick start 走一遍最省事。真正想知道低比特推理跑起来是什么手感,建议直接去翻 README 里的构建步骤和性能说明,再顺手看下 Releases 有没有新的量化脚本。先去读一遍 BitNet 的 README

GitHub项目

Vanna:用大白话直查数据库,把 Text-to-SQL 做进你的应用

被业务拉着要报表又要反复改口径的开发者,很多时间其实消耗在写联表 SQL 上。Vanna 把“自然语言→SQL→结果回显”的完整链路收拢成一套 Python 框架,只需要准备你的数据库 schema 和少量样例,就能生成可解释的查询。它长期保持活跃提交,MIT 许可,想给团队搭一个内部查数助手的人会很对胃口。核心看点- 训练即 RAG,不碰微调:Vanna 先把 DDL、文档和几个示例问题做向量化,查询时找到最相关的表结构再交给 LLM 生成 SQL。换模型成本低,基础原理也好懂。 - 一接口连多种数据库:SQLite、PostgreSQL、Snowflake、BigQuery 等都有适配器,代码里切换数据库不用推翻重写,适合数仓环境不只一套的团队。 - 带展示界面也带 API:内置了一个轻量 Web 聊天页面,同时可以只调用 Vanna 的 Python 函数集成进现有程序;回答会附上 SQL 原文,方便核对与排查。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合被取数需求反复打扰的数据工程师,以及想快速落地一个可用的“企业查数机器人”的开发者。Vanna 本身不绑死某家模型,你只需要任一 OpenAI 兼容或 OpenRouter 的 API Key,想完全本地跑也可以接 Ollama 的兼容端点。安装走 pip 就好,但跑在敏感库上时最好给只读账号权限。整体思路比直接拿着大模型硬写要可控,多表关联场景尤其值得琢磨。想看看它如何设计训练集和连接器,直接去 Vanna 的 GitHub 主页 翻 README 和示例,比自己从零踩坑省时间。

GitHub项目

LlamaIndex:把文档变成 RAG 知识库的编排框架

想让大模型基于自己的私有资料回答,而不是临时翻聊天记录,LlamaIndex 是绕不开的选择之一。它不只帮你读取 PDF、维基和接口数据,把「切分—检索—合成」组织成可复用的模块,适合正在做 RAG 应用或者团队问答工具的人。核心看点给开发者最直观的几点物:多类型索引不只是向量库那一套,摘要索引、知识图谱索引等让不同问题有不同走法;统一数据接入内置几十种 loader,也能和 LangChain、LlamaHub 生态互相借力;高层 API + 可观测性用 query engine 几行代码出结果,回调机制能追踪每一步上下文来源。MIT 许可也让二次定制少些顾虑。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想快速验证 RAG 原型的调研者、做私有知识库的工程师、研究检索策略的人都能用得上。它是 Python 项目,本地装好依赖就能跑;底层模型默认接 OpenAI,也支持换本地推理端点,所以不一定需要 API Key,具体看选哪个 provider。如果觉得 README 入口太多,建议先挑 examples 里的 starter 跑一遍,再决定要不要碰更复杂的索引。动手前记得按仓库 LICENSE 确认自己的使用方式。LlamaIndex 的新思路和新模板更新很快,值得进去看两眼:打开 LlamaIndex

GitHub项目

TEN-Agent:把实时语音+视觉 Agent 装进自己的服务

搭一个能听、能看、能对话的 AI Agent,最烦人的往往不是模型本身,而是把音频流、STT、LLM、TTS 和摄像头输入手动串起来。TEN-Agent 把这套链路做成了可编排的实时多模态 Agent 运行时,适合想快速落地语音助手、智能终端或远程协作场景的开发者。核心看点- 实时多模态对话:支持语音、视频和文本输入同时进 Agent,自带打断与状态控制,不是简单的一问一答。 - 可视化 Agent Graph:用节点方式编排 STT、LLM、TTS 和业务逻辑,改一个分支不用推倒重写,调试时能直接看服务端消息流。 - 模块化后端与干净许可:ASR、LLM、TTS 都可替换接入,仓库以 Apache-2.0 开源,团队拿来改造商用心里比较有底。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示直接先看仓库里的 Playground 示例,按 README 配环境变量即可跑通一个基本对话 Agent。想体验完整语音链路,需要准备 ASR/TTS 或 RTC 厂商的 Key;如果只验证推理逻辑,先开文本模式更省事。文档和 issue 讨论都比较活跃,跟着官方示例比从零看协议更舒服。建议别只看 Readme 第一屏,花几分钟翻一遍 agents 目录和 Graph 示例,很多细节比教程讲得清楚:TEN-Agent 仓库

GitHub项目

TGI 推理服务:本地大模型从 Demo 到上线还差这层

在本地把 Llama/Qwen 跑通不难,难的是把它变成能扛真实请求的在线服务。text-generation-inference(TGI)是 Hugging Face 官方的推理服务端,把连续批处理、量化、流式输出这些部署琐事收进一个进程,适合正在做模型上线或 RAG/Agent 后端的人。核心看点- 一条命令起服务:模型从 HF Hub 下载后,用 Docker 就能拉起推理接口,不用自己拼 web 服务。 - 部署细节内置:支持 GPTQ / AWQ / bitsandbytes 等量化方式,也处理流式输出和消息模板,省去重复的 prompt 工程。 - 生态贴合 HF:底层用 Rust 管理调度,Python 侧接入方便,配合 InferenceClient 或 OpenAI 兼容客户端都能联调。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示想少踩坑,先看 README 里的 Docker 镜像与模型约束再动手;默认适合带 GPU 的 Linux 环境,显存和 CUDA 版本随模型差异而定。拉模型走 HF Hub,网络受限就提前配镜像。仓库许可证为 Apache-2.0,公共模型不需要 API Key,私有模型则按官方 README 准备 token。如果只是想让本地大模型跑到生产环境,这个仓库值得反复比照;它更新节奏稳定,Release 和 Discussions 里能看到镜像版本与模型兼容的演进——查看 text-generation-inference

GitHub项目

Transformers:统一 API,换模型不用重写管线

一个人调模型最怕的不是没显卡,而是今天换这个明天换那个,调用代码跟着返工。Hugging Face Transformers 把主流 NLP、视觉、音频模型收进同一个入口,做模型对比和快速原型的时候特别省事。核心看点接口统一:从 AutoModel 到 pipeline,切模型常常只改模型名和配置,不用整段改写调用逻辑。训练推理一套代码:Trainer 适合跑微调,小模型 CPU 就能 debug,大模型再上 GPU。配套成熟:跟 Datasets、Hub、Accelerate 生态摆在一起,数据加载、权重托管、多卡训练都能接得上,少写很多胶水脚本。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示Python 环境装好直接 pip install transformers 就能跑,普通任务不需要 API Key。若只做推理,很多小模型用 CPU 也能应付;真要微调大模型再准备 GPU。主仓库采用 Apache-2.0 许可,但下载的模型权重时常另带条款,动手前先看对应 Hub 页的 LICENSE。README 的 pipeline 示例最接近零基础,熟悉了以后去 Examples 目录找脚本抄,比重新造轮子踏实。更多细节在 huggingface/transformers 仓库。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.