跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 6 回复
  • 544 浏览

音频分离工具实测:Spleeter/Demucs/UVR5 谁更适合懒人

参与讨论

最近给播客去杂音,对比了下几款分离工具。Spleeter 快得离谱,但边缘残留严重;Demucs v4 质量确实顶,可惜还得配环境;UVR5 界面友好但太吃显卡,跑个两分钟的片段直接爆显存。

主要纠结是选易用性还是画质。有没有不用折腾命令行、效果也不拉胯的轻量级 GUI?或者目前主流做法都是硬着头皮装 UVR5?

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

6s 条评论

  1. 周报难产中
    周报难产中 成长6,027

    回复 @粉笔没落灰:懒人直接用网易云音乐的AI人声分离吧,上传即生成,虽然音质一般但够用了。折腾本地环境太费事,除非对音质有极致追求。

  2. 咖啡续命中
    咖啡续命中 成长10.6k

    可以试试这个顺序,UVR5 换个 `MDX-Net` 架构模型(比如 VR Architecture 下的 Kim_Vocal_2),显存占用比 MP-Net 低很多,且人声分离度比 Spleeter 干净。我上次是这么搞的,配个 6G 显存的卡跑两分钟音频也就两三分钟,不用死磕 V4 版本。

  3. 十万加在逃
    十万加在逃 绽放16.2k
    引用 咖啡续命中

    @咖啡续命中 Kim_Vocal_2 确实稳,显存只要4G就能跑完两分钟的demo,不用死磕高配。

  4. 不测不信邪
    不测不信邪 绽放15.7k

    WebUI 也得装 Python 啊,真·懒人别折腾了。UVR5 爆显存就切到 CPU 模式,慢点但稳,省得配环境掉头发。

  5. 路过点个赞
    路过点个赞 绽放13.2k
    引用 不测不信邪

    WebUI 也得装 Python 啊,真·懒人别折腾了。UVR5 爆显存就切到 CPU 模式,慢点但稳,省得配环境掉头发。

    @不测不信邪 CPU模式跑Demucs确实稳,就是速度感人。其实有个取巧的法子,用UVR5的Vocal Reduction (MP-Net) 模型配合较高分辨率设置,虽然也吃资源但比Spleeter干净太多,不用为了去个杂音搞复杂环境,适合只想一键出活的场景。

  6. 收藏=学会
    收藏=学会 成长11.6k

    @运维祭天 Spleeter 4-stem 版本边缘残留确实严重,建议试试 Demucs v4 的 `htdemucs` 模型配合 WebUI,不用手写代码。显存爆了就开 `--two-stems vocals` 单独剥离,比硬扛 UVR5 强多了。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.