跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 11 回复
  • 971 浏览

Whisper Base vs Large V3,本地跑转录耗时对比

参与讨论

不依赖在线API,在本地RTX 3060上测 Whisper 基础版和大模型的离线转写速度。主要跑1小时长的清晰会议录音,看CPU占用和最终WER(字错误率)。

Base版只要4分钟,但专业名词翻车严重,得人工校对半天;Large V3花了25分钟,WER低很多,基本能直接出稿。对于对准确性要求高的场景,多等20分钟是值得的,Base版只适合快速粗听。有链接找模型去。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

11s 条评论

  1. 午后续命水
    午后续命水 成长9,188

    WER 没标置信度区间,单样本测不准。3060 跑 Large V3 记得关 CUDA Graph,不然启动延迟能把你心态搞崩。

  2. 咖啡续命中
    咖啡续命中 成长10.6k

    我上次是这么搞的,3060跑Large V3把offload_layer设高点,别让CPU瓶颈拖慢速度。Base版虽然快但校对成本高,长期看还是大模型省心。

  3. 摸鱼不划水
    摸鱼不划水 成长5,220

    回复 @设计稿又改了:马克一下。Base 省那 20 分钟,结果人工校对花了两倍时间,这性价比属实感人,大型模型才是生产力啊。

  4. 一句封神
    一句封神 绽放16.2k

    emmm 3060 跑 large v3 其实还好,主要是 base 版错别字多到让人想砸键盘。为了那点校对时间,我宁愿等 25 分钟出成品,毕竟人工校对比推理还累。

  5. 午后续命水
    午后续命水 成长9,188

    @佛系打工人 1小时单样本不算严谨,WER受口音影响极大。3060跑Large V3 offload_layers建议设高一点,不然CPU瓶颈更明显。

  6. 路过点个赞
    路过点个赞 绽放13.2k
    引用 午后续命水

    @佛系打工人 1小时单样本不算严谨,WER受口音影响极大。3060跑Large V3 offload_layers建议设高一点,不然CPU瓶颈更明显。

    3060跑Large V3确实得优化offload,不然CPU一忙显存再快也卡脖子。Base省那20分钟,校对得花两小时,这账算下来还是大模型香。

  7. 前端背锅侠
    前端背锅侠 成长6,961

    1小时录音WER差这么多?样本量够吗,单轨清晰音容易掩盖大模型在并发语境下的优势。Base版省的是时间,丢的是准确率,这账得算清楚。

  8. 剪到凌晨四点
    剪到凌晨四点 成长4,580

    @Debug到秃头 3060 12G 显存其实够硬。不过 base 翻车确实是常态,大型模型对同传噪音鲁棒性强太多,渲染等了俩小时换来直接定稿,值了。

  9. 下次一定改
    下次一定改 成长9,324

    3060跑Large V3显存吃紧吧?我上次测1.5G显存直接OOM,你是开的int8量化还是fp16?另外会议录音如果有多人重叠发言,Base版的WER通常会指数级上升,光看清晰单声道不够严谨。

  10. 安全佬路过
    安全佬路过 成长9,731
    引用 下次一定改

    3060跑Large V3显存吃紧吧?我上次测1.5G显存直接OOM,你是开的int8量化还是fp16?另外会议录音如果有多人重叠发言,Base版的…

    回复 @Debug到秃头:3060 int8 还能跑,fp16 直接爆显存。多人重叠那段才是坑,Base 版在那种环境下基本废了,这对照组确实没拉满。

  11. paper难产中
    paper难产中 绽放12.2k
    引用 下次一定改

    3060跑Large V3显存吃紧吧?我上次测1.5G显存直接OOM,你是开的int8量化还是fp16?另外会议录音如果有多人重叠发言,Base版的…

    related work 里见过类似结论,Base 在专业领域基本是废柴。3060 跑 Large V3 记得把 offload 拉满,不然 CPU 调度开销能把耗时翻倍,实测下来还是大模型省心。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.