跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 7 回复
  • 752 浏览

Ollama 跑 Llama3 4bit 显存爆满求优化

参与讨论

最近折腾本地部署 Llama-3-8b-instruct,用的是 Ollama 默认配置。显存 12G 的卡,量化到 4bit 居然还 OOM,日志显示 kv cache 占用异常高。网上说的 offload 策略好像没生效。

有大佬知道怎么在 docker 环境下手动调整 gpu_layers 或者限制 max_seq_len 来强行塞进去吗?不想换显卡,只想榨干现有硬件。求具体命令或配置文件修改方案。Ollama GitHub

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

7s 条评论

  1. 围观不发言
    围观不发言 萌芽2,308

    回复 @十万加在逃:默认 KV Cache 确实吃内存,改下 config.json 限制 context_length 试试。或者直接用 Docker 部署文档 里的显存隔离配置,别硬扛 12G 跑 8B。

  2. 五百一天Ken
    五百一天Ken 成长11.9k

    @周末补作业 12G 硬刚 llama3 太折磨人,换 bartowski 的 GGUF 用 llamacpp 跑,num_ctx 设 2048 足够用,这配置接私活够用了。

  3. 收藏=学会
    收藏=学会 成长11.6k

    @周末补作业 12G 跑 llama3-8b 4bit 本身就很极限,光模型权重就吃满了。建议把 Ollama 升级最新版,参考 Ollama GitHub,通过 env 设置 OLLAMA_NUM_GPU=-1 和减少 num_ctx 来释放显存,别硬扛。

  4. 午后续命水
    午后续命水 成长9,188
    引用 收藏=学会

    @周末补作业 12G 跑 llama3-8b 4bit 本身就很极限,光模型权重就吃满了。建议把 Ollama 升级最新版,参考 Ollama GitHub,通过 env …

    别在那改 ng了,12G 跑 llama3-8b 哪怕 4bit 也捉襟见肘,kv cache 才是显存杀手。直接用 `num_ctx 2048` 截断上下文,这参数在 ModelFile 文档 里写得明明白白,省下来的显存够模型权重跑了。

  5. 十万加在逃
    十万加在逃 绽放16.2k
    引用 午后续命水

    别在那改 ng了,12G 跑 llama3-8b 哪怕 4bit 也捉襟见肘,kv cache 才是显存杀手。直接用 `num_ctx 2048` 截断上下文,这参数在 Model…

    @午后续命水 说得太对了,KV Cache 才是真凶。试了下把 num_ctx 压到 2048 配合 Ollama 官方文档 里的显存隔离配置,终于跑通了,12G 也能喘口气。

  6. 一句封神
    一句封神 绽放16.2k
    引用 午后续命水

    别在那改 ng了,12G 跑 llama3-8b 哪怕 4bit 也捉襟见肘,kv cache 才是显存杀手。直接用 `num_ctx 2048` 截断上下文,这参数在 Model…

    12G 跑 Llama3 8B 确实有点极限,KV Cache 才是显存杀手。@午后续命水 提到的 num_ctx 2048 是正道,建议配合 ModelFile 里的参数限制上下文长度,别贪多。

  7. 路过点个赞
    路过点个赞 绽放13.2k

    试试直接改系统配置,`ollama run --ngl 99 llama3` 强制全进显存。要是还是爆,去官方看参数文档 ModelFile 调低 `num_ctx`,别贪大上下文。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.