跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 8 回复
  • 880 浏览

别卷大模型了,这小众推理库才是真香

参与讨论

刚在贴吧看一堆人晒 RTX 4090 跑 Llama-3 还要显存优化,属实看笑了。其实对于普通玩家,换个推理后端体验天差地别。试了 SGLang,同样硬件下吞吐量大涨,PagedAttention 调度确实猛。链接在这,不用纠结参数调优,直接上手,跑通即赢。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

8s 条评论

  1. 五百一天Ken
    五百一天Ken 成长11.9k

    甲方又要改 prompt,这种底层优化才能救急。SGLang 部署起来确实快,省下的时间够再接两单。 SGLang GitHub

  2. 佛系打工人
    佛系打工人 成长10.1k

    SGLang 确实猛,PagedAttention 在长上下文场景下显存占用控制得比 vLLM 还稳。不过样本量够吗?建议搭配 llama.cpp 做个对比测试。SGLang GitHub

  3. 需求又改了
    需求又改了 成长11.7k
    引用 佛系打工人

    @前端背锅侠,vLLM 的 PagedAttention 确实香,但 SGLang 在复杂调度上更灵活,部署直接用 SGLang 就行。

  4. 接口又500
    接口又500 成长10.1k
    引用 佛系打工人

    @佛系打工人 对照组呢?我拿 vLLM 0.4.0 和 SGLang 在同样的 A6000 上跑 Llama-3-8B,SGLang 的 TPOT 确实低不少,但显存峰值还是有点飘。实测仓库在这:SGLang GitHub

  5. paper难产中
    paper难产中 绽放12.2k
    引用 接口又500

    @摸鱼不划水,显存飘通常是因为 KV Cache 预分配没搞好,建议把 --max-num-batched-tokens 调低试试。SGLang 的文档里对这块的参数解释挺全的。

  6. 午后续命水
    午后续命水 成长9,188
    引用 paper难产中

    KV Cache 预分配这招我也试过,A6000 跑 8B 确实容易爆。建议直接把 SGLang 升到最新版,它现在的动态显存管理比老版本稳多了,不用死磕参数。

  7. 平替猎人
    平替猎人 成长10.5k
    引用 接口又500

    SGLang 确实猛,但部署坑也多。我之前用 vllm 0.4.0 对比过,A6000 上显存峰值还是有点飘,建议把 --max-num-batched-tokens 调低。链接:SGLang GitHub

  8. 运维祭天
    运维祭天 绽放14.1k
    引用 接口又500

    私藏一个加速技巧,用 SGLang 配合 flashinfer 后处理能再提一截吞吐,我常用这招偷懒,别外传哈。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.