跳到内容

下午好,继续加油,离目标更近一步。

GitHub项目

共 114 篇文章

GitHub项目
最新

DeepSpeed 不止省显存:训练推理一把抓的开源提速库

如果你和我一样,在本地调大模型时总被 OOM 劝退,DeepSpeed 值得花十分钟看一下。这是微软开源的深度学习优化库,专治大模型训练和推理时的显存焦虑,Apache-2.0 协议,社区相当活跃,不是躺在仓库里吃灰的项目。核心看点- ZeRO 系列优化:把模型参数、梯度、优化器状态切分到多卡或多设备上,配合 Offload 还能把部分数据放到 CPU/SSD,让原来塞不进的模型跑起来。对单卡玩家和集群用户都有实际帮助。- 推理能力同样能打:支持 DeepSpeed-Inference,包含内核融合、稀疏算子、KV Cache 等优化,同一套工具链从训练过渡到部署,不用来回切换框架。▲ github.com(阿里云通义万相 生成配图,非网页截图)- 上手不算陡:继承自 PyTorch 的写法,对已有代码改造量小。常用功能都有文档和示例,遇到问题在 GitHub Issues 里找答案很方便。适合谁主要面向用 PyTorch 做大模型训练、微调或推理的工程师与研究者。如果手里只有一两张消费级显卡,又想跑超出显存容量的模型,ZeRO-Offload 值得试试。需要熟悉 Python 和 PyTorch 基础,按 README 安装依赖即可,不需要额外 API Key。想了解具体的 ZeRO 阶段、Offload 策略和推理加速配置,直接去仓库的 README 和官方文档翻一翻。动手之前记得先确认你的 PyTorch 和 CUDA 环境匹配,再对照示例跑通一个模型,感受会直观很多:进入 DeepSpeed 仓库

GitHub项目
最新

tinygrad:用很少的代码读懂深度学习与大模型推理

绝大多数人用深度学习框架就是调 API,想亲眼看清张量、自动求导、反向传播到底怎么运作,往往被 PyTorch 那几十万行代码劝退。tinygrad 把核心逻辑压缩得很紧凑,同时又保留了可用的训练和推理能力,适合想拆开黑盒的工程师和研究爱好者。核心看点- 极简内核:用相对很少的代码实现张量、自动求导和常见优化器,阅读它比啃 PyTorch 源码轻松得多。 - 多后端支持:同一套模型可跑在 CPU、CUDA、OpenCL、WebGPU 上,换设备时不用改写业务代码。 - 能训也能推理:既能训练小型模型,也能加载类似 LLaMA 的权重做推理,用来理解大模型内部机制正合适。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想真正理解框架底层原理的开发者,或需要在不同设备上做轻量推理的爱好者。项目基于 Python,依赖少,纯 CPU 环境就能跑;GPU 版需要对应的驱动或 CUDA 环境,不需要 API Key。如果你早已厌倦把框架当黑盒用,点进 README 从代码目录开始走读,会有种豁然开朗的感觉。打开 tinygrad 仓库 看看它是如何在紧凑代码里撑起一个完整的深度学习栈。

GitHub项目
最新

Qwen-Agent:让通义千问学会调用工具的开源 Agent 框架

写 RAG 或多步推理时,最烦的就是把大模型和工具调用粘在一起自己造轮子。Qwen-Agent 是阿里开源的一套轻量 Agent 框架,专门围绕 Qwen 系列模型设计,装完就能让模型自己决定调什么函数、传什么参数,适合想快速把通义千问接进业务流的开发者。核心看点- 原生函数调用:内置与 Qwen 模型对齐的 tool calling 机制,定义好 JSON Schema 就能让模型自主选择工具,少走 prompt 调优弯路。 - 多 Agent 协同:支持拆分子任务给不同 Agent,再汇总结果,做简单编排不用再引入重型框架。 - 开箱即用:提供命令行交互和 API 两种模式,本地跑通只需 Python 环境加一个模型服务,对研究者和原型验证都很友好。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想用通义千问系列模型落地 Agent 场景的开发者,比如做代码助手、信息查询工具或流程自动化。默认对接 DashScope API,也可以切换到本地部署的 Qwen 模型;需要准备 API Key,但仓库里给了完整的示例和文档,照着改就行。如果你最近正好在对比不同 Agent 框架,值得点开 Qwen-Agent 的 README 看看它的设计取舍,尤其适合搭过 LangGraph 但嫌重的人。

GitHub项目
最新

Perplexica:本地自托管 AI 搜索,隐私与体验兼得

想要 Perplexity 那样的智能搜索体验,却不想把每次查询都交给第三方服务?Perplexica 是一个能完整跑在自己服务器上的 AI 搜索引擎,从索引到生成答案都由你掌控,特别适合对数据隐私敏感的开发者或研究者。核心看点- 本地推理优先:可接入 Ollama 或 llama.cpp 等本地模型,也支持 OpenAI、Claude 这类远端 API,切换不锁死。 - 多搜索模式:内置日常对话、学术检索、视频查找等多种模式,返回结果时附带引用来源,比单纯调用大模型更贴近真实搜索场景。 - 部署友好:提供 Docker 镜像,一条命令就能启动;界面风格接近主流 AI 搜索产品,上手成本低。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想给团队做一个私有化知识入口的工程师,或者不想让查询记录离开本机的个人用户。如果你已有一台能跑 7B 级别模型的机器,配合 Ollama 即可全本地运行;想快速尝鲜,也只需配置一个 OpenAI API Key 就能体验完整功能。项目基于 MIT 许可证,可放心二次改造。想对比不同模型在搜索场景下的表现,建议直接去 Perplexica 仓库 看 README 里的部署指引,顺便翻翻 Issues 里大家分享的配置经验。

GitHub项目

llm.c:几百KB C代码跑GPT-2,Karpathy手把手拆解训练

想搞懂大模型训练时那些反向传播、梯度下降到底在干什么?Karpathy 的 llm.c 把 GPT-2 的推理和训练压缩进一个纯 C 文件,不装 PyTorch 也能跑起来。适合想从框架里跳出来、亲眼看看 Transformer 每一步计算的开发者,也适合研究生或爱好者拿来做实验底稿。核心看点- 纯 C 实现:没有 Python 依赖,CPU 上即可编译运行;GPU 版用 CUDA 写出可对比的 kernel,让你看清 PyTorch 里那些『魔法』本质。 - 完整训练流程:不是玩具,它包含数据加载、前向、反向、AdamW 优化器,真正训练出可用的小规模 GPT 模型。 - 自带参考实现:仓库同时提供 PyTorch 参考代码,方便对照 C 版本验证数值和梯度,理解每层数学推导。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示适合机器不太够用的同学:单张消费级显卡甚至纯 CPU 都能跑通小配置,只需装好 C 编译器和 CMake;不必申请任何 API Key。想立刻动手,先跑 ./run.sh 或按 README 指引编译,然后观察 loss 下降。如果你想复现更大的 GPT-2 规模,建议使用带 CUDA 的 NVIDIA 显卡,显存越大越省心。想自己修改注意力机制或换数据集,仓库结构很短,读代码比查文档快。具体依赖、复现脚本和已知问题都在 llm.c 的 README 里,最近提交仍在更新,值得点进来看一眼。

GitHub项目

AnythingLLM 开源知识库:文档秒变可聊天的 AI 助理

每次想用 AI 查内部资料,都得把文档上传到云端,多少有点不放心。AnythingLLM 用 RAG 把这些文件变成可对话的私有知识库,本地部署,模型随便选,适合既想要效率又在意数据控制权的开发者和团队。核心看点- 模型随意接:OpenAI、Gemini、Claude 还是本地 Ollama,一个界面统一管,不用在多个后台来回切。 - 自带向量检索:不用单独搭向量数据库,内置的嵌入和检索足够对付中小型知识库,省掉一堆基础设施。 - 部署门槛低:桌面版一键安装,服务器版一条 Docker 命令就能跑起来,MIT 许可,二次开发也方便。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想给团队搭一个私有 AI 问答入口的工程师,或者不想写前端、急着把文档工具化的产品经理。日常使用不需要 GPU,API Key 看你选的模型决定,本地模型则完全离线。上手速度比想象中快:拖入文档、连上模型、开始提问,十分钟内能从零跑到第一条回答。如果想深入了解工作和插件的设计思路,直接翻 AnythingLLM 仓库 的 README,权限、多用户和配置说明都写得很清楚。

GitHub项目

VideoLingo AI 视频翻译配音全自动,生肉剧集轻松啃

追生肉、剪课程、做二创时,字幕和配音总是最磨人的一步:手动切时间轴,机翻腔又没温度。VideoLingo 把语音识别、翻译、打轴、配音串成一条自动化流水线,适合外语学习者、视频 UP 主和不想折腾复杂命令行的普通玩家。核心看点- 全流程一体:从视频提取语音到生成字幕、翻译、配音,一条命令跑完,不用在多个工具间反复横跳。 - 翻译有「人味」:不是简单逐句机翻,而是结合上下文润色,出来的字幕读着顺,配音听感也更自然。 - 部署伸缩自由:本地有简易操作界面,API Key 和本地模型都支持,从尝鲜到批量处理都能覆盖。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁外语学习者、剪辑师、追剧党,以及想做海外面签视频的中长尾创作者。需要准备对应模型的 API Key(如 OpenAI 或 Anthropic),也可改用本地推理;具体依赖和许可证以仓库 README 为准。想看看实际效果和配置步骤,直接去 VideoLingo 的 README 对照着跑,比自己猜快得多。

GitHub项目

llamafile:把大模型打包成单文件,双击就能跑

跑本地大模型是不是总要先装 Python、配 CUDA、再拉一堆依赖?llamafile 把模型权重和推理引擎全部塞进一个可执行文件,双击或一条命令就能启动,适合想快速体验本地模型的开发者,也适合要把模型分发给非技术用户的场景。核心看点- 单文件分发:一个文件同时包含模型和运行时,Linux、macOS、Windows 都能直接执行,省去环境配置的折腾。 - 格式兼容广:支持 GGUF 以及 Llama、Phi、Mistral 等主流架构,命令行里 -m model.llamafile 即可加载,模型文件后缀统一为 .llamafile。 - 自带 Web 聊天界面:启动后自动打开浏览器可视化对话页,无需额外搭前端,同时还提供 OpenAI 兼容 API,方便接入现有工具。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁面向想逃开环境配置的本地推理玩家,以及希望把模型作为独立程序交付给同事或客户的人。CPU 也能跑小尺寸量化模型,不强制要求 GPU;Apache-2.0 许可,个人使用和二次修改都比较自由,具体以仓库 LICENSE 为准。想看看有哪些现成模型可以直接下载体验,或者了解怎么把自己的 GGUF 模型打包成单文件,建议直接逛 README 和 Releases 里的示例资源:Mozilla-Ocho/llamafile

GitHub项目

Instructor:让大模型输出直接变成 Python 对象

还在对着 choices[0].message.content 手写 JSON 解析,一边担心字段缺失一边写重试?Instructor 就是针对这个场景的库,适合天天和大模型 API 打交道的 Python 开发者。它把「结构化输出」变成声明式配置,模型返回什么、怎么校验,用 Pydantic 一页纸说清楚。核心看点- response_model 一步到位:把 response_model=User 追加到 chat completion 参数里,拿回来的直接是 Pydantic 实例,而不是乱糟糟的字符串。 - 多后端都接得住:OpenAI、Anthropic、Gemini、Mistral,连 llama-cpp-python 本地模型也可以,切换成本比想象中低。 - 自动重试纠偏:模型输出不符合 schema 时,Instructor 会把校验错误传回模型并自动重试,省掉大量后处理代码。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁给 Agent 做函数参数抽取、做信息抽取落库的 AI 应用开发者,或者想少写 prompt 解析逻辑的研究者。需要 Python 3.9+,用云端模型要自己配 API Key;玩本地模型则再加一个 llama-cpp 依赖。许可证是 MIT,源码可直接读。真想提升 Agent 稳定性,与其堆提示词,不如把输出钉在类型上。更多流式与多轮补全的玩法,去 README 里的 examples 挖一挖:instructor 仓库主页。

GitHub项目

ms-swift:一条命令微调全模态大模型,LoRA 和 DeepSpeed 都搞定

微调一个开源模型,光是环境适配、数据格式化、多卡并行就够劝退一半人。ms-swift 把这一整套流程收敛为命令行工具,适合想快速验证直觉的算法工程师和研究者。核心看点- 全模态覆盖:除了常规 LLM,也支持视觉、语音等多模态模型的微调、推理与导出,省掉四处找轮子的时间。 - 训练配置开箱即用:内置 LoRA、QLoRA、全参微调以及 DeepSpeed 策略,能直接套用现成脚本,日志清晰,调试相对省心。 - 生态丰富:兼容多种模型格式与数据集来源,自动下载模型权重,社区活跃,踩坑记录容易搜到。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁有基础 GPU 环境、想做模型微调或风格定制,但不想从零搭建训练链路的人。普通开发者可以用小模型先跑通 demo;研究者也能方便复现对比实验。不需要 API Key。项目采用 Apache-2.0 许可证,模型权重使用时以各模型本身许可为准。如果你正在比较不同微调框架,建议直接打开ms-swift 的 README 查看支持矩阵与快速上手命令,文档里还附了常见任务示例。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.