阅读要点
先读这里,快速了解全文在讲什么
核心结论
想在本地跑 DeepSeek-R1 这类大 MoE,一看显存需求就被劝退——ktransformers 就是冲这个场景来的。它把稀疏专家权重放到 CPU 内存,把注意力等密集计算留给 GPU,让单卡甚至纯 CPU 的工作站也有机会把模型跑起来,适合想本地做私有部署的开发者与研究者。核心看点- CPU + GPU 异构推理:MoE 专家层卸载到内存,显存压力明显减小,手里显卡一般但内存够大就能试。 - 工程优化到位:算子基于 GGML/l…
你可以了解到
阅读后可获得与「ktransformers:显存不够也能跑 DeepSeek MoE」相关的实用信息与站内延伸资源;最后更新 2026年9月11日。
延伸阅读
想在本地跑 DeepSeek-R1 这类大 MoE,一看显存需求就被劝退——ktransformers 就是冲这个场景来的。它把稀疏专家权重放到 CPU 内存,把注意力等密集计算留给 GPU,让单卡甚至纯 CPU 的工作站也有机会把模型跑起来,适合想本地做私有部署的开发者与研究者。
核心看点
– CPU + GPU 异构推理:MoE 专家层卸载到内存,显存压力明显减小,手里显卡一般但内存够大就能试。
– 工程优化到位:算子基于 GGML/llama.cpp 生态,针对 x86 做了多线程、Intel AMX 等加速路径,也支持量化权重。
– 接口友好:自带风格接近 OpenAI 的本地服务端,接现成前端或 Agent 流程不用大改代码。

适合谁
典型场景是本地验证 MoE 大模型、做内网私有推理。需要 Python 环境和编译工具链,Windows 与 Linux 各有安装说明;模型权重体积不小,下载前先对照仓库里的兼容性表格,确认硬件与量化方案,权重与代码的许可条款以仓库 LICENSE 为准(代码为 Apache-2.0)。
建议先翻 README 的支持列表再决定动不动手,安装踩坑与更新动态可以顺手关注 ktransformers。

