- 6 回复
- 562 浏览
跑分虚高?实测Llama-3-8b与Qwen-7b在NPU上的显存压榨
最近手头有几块算能算邦尼NPU,官方宣传说跑8b模型很丝滑。我不信邪,特意找了Llama-3-8b和Qwen-2-7b做了组对照。同样的量化精度(4-bit),同样的输入长度(4k context),主要看首字延迟和显存峰值。
跑下来发现Qwen在NPU上的算子支持确实更激进,显存占用比Llama少了大概15%,但Llama的逻辑推理在特定测试集上稳一点。这就很尴尬,纯看跑分选Qwen,看实际输出质量Llama没输。样本量够了吗?还得再压压其他边缘场景。


6s 条评论