跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 6 回复
  • 563 浏览

跑分虚高?实测Llama-3-8b与Qwen-7b在NPU上的显存压榨

参与讨论

最近手头有几块算能算邦尼NPU,官方宣传说跑8b模型很丝滑。我不信邪,特意找了Llama-3-8b和Qwen-2-7b做了组对照。同样的量化精度(4-bit),同样的输入长度(4k context),主要看首字延迟和显存峰值。

跑下来发现Qwen在NPU上的算子支持确实更激进,显存占用比Llama少了大概15%,但Llama的逻辑推理在特定测试集上稳一点。这就很尴尬,纯看跑分选Qwen,看实际输出质量Llama没输。样本量够了吗?还得再压压其他边缘场景。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

6s 条评论

  1. 谨言慎行plus
    谨言慎行plus 成长9,289

    @十万加在逃 @咖啡续命中 交付掉确实没戏,这玩意一旦遇到不支持层就得重写,合规风险这块得提前评估好算子兼容性。合同里建议写清楚兜底方案,别光看跑分。

  2. 安全佬路过
    安全佬路过 成长9,731

    @深夜改BUG,SDK 4.2 才稳,之前 4.0 跑 Llama3 直接 OOM。Qwen 是算子适配早,逻辑差在 tokenizer 上。

  3. 咖啡续命中
    咖啡续命中 成长10.6k
    引用 安全佬路过

    @深夜改BUG,SDK 4.2 才稳,之前 4.0 跑 Llama3 直接 OOM。Qwen 是算子适配早,逻辑差在 tokenizer 上。

    @安全佬路过 SDK版本确实是玄学,我上次用4.0跑Llama3也炸显存了。换个思路,既然都是算能板,不如直接比rknn-toolkit的转化成功率,Qwen那套算子虽然快,但转成rknn经常报不支持层,Llama虽然慢点至少稳定,跑分虚不虚看具体指令集就行。

  4. 十万加在逃
    十万加在逃 绽放16.2k
    引用 咖啡续命中

    @咖啡续命中 转换成功率才是爹。之前为了赶进度没细看,结果Qwen有个自定义算子死活转不过去,最后只能手动改写。跑分再好看,交付不掉也是白搭。

  5. 不测不信邪
    不测不信邪 绽放15.7k
    引用 十万加在逃

    SDK 4.2 稳是真的,但 Qwen 那堆自定义算子转 rknn 能把人逼疯,交付才是硬道理。

  6. 夜班调参侠
    夜班调参侠 成长3,318
    引用 十万加在逃

    @Momo摸鱼画手,这也能行?手动改写算子简直是赛博服刑,还是老老实实用Llama吧,稳得住才能交差。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.