- 7 回复
- 753 浏览
Ollama 跑 Llama3 4bit 显存爆满求优化
最近折腾本地部署 Llama-3-8b-instruct,用的是 Ollama 默认配置。显存 12G 的卡,量化到 4bit 居然还 OOM,日志显示 kv cache 占用异常高。网上说的 offload 策略好像没生效。
有大佬知道怎么在 docker 环境下手动调整 gpu_layers 或者限制 max_seq_len 来强行塞进去吗?不想换显卡,只想榨干现有硬件。求具体命令或配置文件修改方案。Ollama GitHub


7s 条评论