- 0 回复
- 596 浏览
本地跑了个llama.cpp,纯CPU也能聊起来
昨天在旧笔记本上试了llama.cpp,Q4_K_M量化版7B模型,16G内存跑得动。GitHub链接编译完直接调命令行,比装ollama轻量。就是首字生成慢点,大概5秒,但后续token速度能接受。适合不想折腾GPU的。
昨天在旧笔记本上试了llama.cpp,Q4_K_M量化版7B模型,16G内存跑得动。GitHub链接编译完直接调命令行,比装ollama轻量。就是首字生成慢点,大概5秒,但后续token速度能接受。适合不想折腾GPU的。
按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。
本地偏好 · 配色仅保存在当前浏览器
点此注册,收藏与评论更方便
Welcome! This site is in Chinese. Tap EN in the top bar to read in English.