跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 6 回复
  • 784 浏览

求个能提取播客音频转文字并保留说话人标签

参与讨论

最近在整理行业访谈的播客资源,手动听写太废眼睛。之前的ASR工具分不清是谁在说话,全是混在一起的文本,没法复用。

需要本地能跑的方案,支持VAD(语音活动检测)自动切分段落,并标注Speaker 1、Speaker 2。最好能兼容常见的WAV或FLAC无损格式。有链接吗

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

6s 条评论

  1. 深夜改BUG
    深夜改BUG 绽放14.4k

    回复 @一句封神:可以试试这个顺序:先用 pyannote.audio 做 Speaker Diarization 提取说话人时间戳,再拿 whisper-large-v3 针对每个片段单独转写,这样能精准对应 Speaker 1/2,比直接用带 diarization 的大模型更稳,尤其是处理交叉语速的时候。

  2. 五百一天Ken
    五百一天Ken 成长11.9k

    @谨言慎行plus,本地跑这玩意儿太耗算力,上次那单我直接推了,客户嫌贵。这种纯体力活还是外包给云端 API 划算,交付快还没售后麻烦。

  3. BurnRate老王
    BurnRate老王 成长11.1k
    引用 五百一天Ken

    @谨言慎行plus,本地跑这玩意儿太耗算力,上次那单我直接推了,客户嫌贵。这种纯体力活还是外包给云端 API 划算,交付…

    @五百一天Ken 云端API确实省心,不过按token计费跑长音频太烧钱了,我上次做个2小时的访谈光API费就干出去两百多块。还是本地搞稳妥,pyannote 3.1 + whisper.cpp int8 量化版,显存控制在6G以内,跑完还能自己存库,长期看省钱。

  4. 佛系打工人
    佛系打工人 成长10.1k

    @五百一天Ken whisper.cpp 虽然省显存,但 diarization 精度远不如 pyannote,混音严重的访谈很容易把同一人说成两人。@平替猎人 建议直接上 `pyannote-speech-detection` + `whisper-large-v3-turbo` 的组合,v3-turbo 速度提升 3 倍,4060Ti 16G 都能跑,采样量够了再调阈值。

  5. 五百一天Ken
    五百一天Ken 成长11.9k

    @收藏=学会 Pyannote.audio 本地跑完全没问题,配合 whisper-large-v3 做转写,Speaker Diarization 效果很稳,WAV FLAC 都支持,就是显存得够大,4090 随便整。这配置跑下来一小时音频大概几十分钟,我上周刚帮客户处理过类似的访谈,交付挺快的。

  6. 平替猎人
    平替猎人 成长10.5k
    引用 五百一天Ken

    @摸鱼不划水 pyannote 3.1.0 搭配 whisper.cpp 量化版,显存占用能压到 8G 以下,不用 4090 也能跑。本地部署的话记得把 VAD 阈值调低一点,不然快语速访谈容易漏切。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.