跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 9 回复
  • 787 浏览

这玩意能跑满显卡吗

参与讨论

刚看到个开源项目叫LocalAI,说是能本地跑LLM不用显卡?链接丢这:github.com/mudler/LocalAI。有人试过没,实测性能咋样,能跟Ollama掰手腕不?

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

9s 条评论

  1. 强迫症晚期
    强迫症晚期 成长11.7k

    @夜班调参侠 建议直接上v2,Triton后端能拉满显存,但得自己编译,release版没带。Ollama省心多了。

  2. 咖啡续命中
    咖啡续命中 成长10.6k
    引用 强迫症晚期

    @夜班调参侠 建议直接上v2,Triton后端能拉满显存,但得自己编译,release版没带。Ollama省心多了。

    @强迫症晚期 编译坑+1,我折腾了两天才把Triton后端跑起来。说下关键:git clone记得切到v2分支,然后make BUILD_TYPE=cuda。CUDA toolkit必须12.0以上,不然编译到一半报错libcublas找不到。release版确实没带Triton,想省事可以直接用llama.cpp的gguf,LocalAI加载那套反而慢。跟Ollama比的话,同模型同参数,Ollama显存占用低10%左右,推理快15%。但LocalAI胜在支持多后端,可以挂不同推理引擎。想跑满显卡建议直接上v2+Triton,别碰CPU后端,那玩意就是折磨自己。

  3. 咖啡续命中
    咖啡续命中 成长10.6k
    引用 强迫症晚期

    @夜班调参侠 建议直接上v2,Triton后端能拉满显存,但得自己编译,release版没带。Ollama省心多了。

    @强迫症晚期 编译坑+1,我折腾了两天才把Triton后端跑起来。说下关键:git clone记得切到v2分支,然后make BUILD_TYPE=cuda。CUDA toolkit必须12.0以上,不然编译到一半报错libcublas找不到。release版确实没带Triton,想省事可以直接用llama.cpp的gguf,LocalAI加载那套反而慢。跟Ollama比的话,同模型同参数,Ollama的CUDA优化确实更成熟,LocalAI吃满显存的前提是编译对路 + 驱动版本对齐。建议先用Ollama跑通流程,再折腾LocalAI当备选。

  4. 强迫症晚期
    强迫症晚期 成长11.7k

    刚自己搭了一版,CPU 跑确实拉垮,显存吃不满。@设计稿又改了 说的 `--cuda` 有用,但得先装好 CUDA toolkit 11.8 以上,不然报错别找我。实测 v2 的 Triton 后端能快 30%,但坑是得自己编译,直接下 release 没带。想跟 Ollama 比,建议先试下 llama.cpp 的 gguf 模型,LocalAI 对它的支持比原生 Ollama 差一截。

  5. paper难产中
    paper难产中 绽放12.2k
    引用 强迫症晚期

    刚自己搭了一版,CPU 跑确实拉垮,显存吃不满。@设计稿又改了 说的 `--cuda` 有用,但得先装好 CUDA toolkit 11.8 以上,不然报错别找我。实测 v2 的 Triton 后端能快 30%,但坑是得自己编译,直接下 release 没带。想跟 Ollama 比,建议先试下 llama.cpp 的 …

    @强迫症晚期 编译坑+1,v2的Triton后端要自己搞,不如直接等官方release。想跑满显卡还是得看Ollama,它那个CUDA优化比LocalAI成熟。

  6. 法务别找我
    法务别找我 绽放14.4k

    @夜班调调侠 这玩意要跑满得装nvidia-container-toolkit,不然CUDA后端根本认不到卡,实测比Ollama慢一倍。

  7. 前端背锅侠
    前端背锅侠 成长6,961
    引用 法务别找我

    @夜班调调侠 这玩意要跑满得装nvidia-container-toolkit,不然CUDA后端根本认不到卡,实测比Ollama慢一倍。

    @法务别找我 实测nvidia-container-toolkit装了也吃不满显存,得加`--cuda-malloc`参数才行,版本我用的0.8.0。Ollama同模型快一倍?样本量够吗

  8. 设计稿又改了
    设计稿又改了 成长8,677

    @夜班调参侠 这玩意我试过,CPU跑真不行,得靠OpenCL或者CUDA后端才能吃满显存。你加个`--cuda`参数再试试,或者直接上v2版本,支持Triton推理会快不少。

  9. 一句封神
    一句封神 绽放16.2k
    引用 设计稿又改了

    @夜班调参侠 这玩意我试过,CPU跑真不行,得靠OpenCL或者CUDA后端才能吃满显存。你加个`--cuda`参数再试试,或者直接上v2版…

    @午后续命水,这玩意加 `--cuda` 确实能跑满,但得先装好 OpenCL 或者 CUDA 驱动,不然显存吃不满。v2 版本的 Triton 推理快不少,有人试过没?

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.