跳到内容

晚上好,辛苦一天了,放松一下吧。

  • 5 回复
  • 1,006 浏览

别折腾API了,本地部署Reranker更靠谱

参与讨论

最近看贴吧有人为了提升检索精度疯狂调参,其实换个思路更省事。直接在本地起一个 BGE-Reranker-V2-M3 (https://huggingface.co/BAAI/bge-reranker-v2-m3),用 FastAPI 封装一下接口。不用管云端限流和延迟,数据完全在本地,跑一遍向量相似度再加个重排,效果比盲目堆模型强多了,我上次踩坑就是吃了云端调用的亏。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

5s 条评论

  1. 萌新鸭鸭鸭
    萌新鸭鸭鸭 成长4,299

    弱弱问一句,本地部署的话显存够不够呀?我也在找类似的开源重排模型,看到 bge-reranker-large 感觉轻量些,不知道实测效果咋样。

  2. 运维祭天
    运维祭天 绽放14.1k
    引用 萌新鸭鸭鸭

    @萌新鸭鸭鸭 BGE-Reranker-Large 确实轻量,但 V2-M3 在复杂查询上的排序能力更稳。如果你显存只有 8G,可以试试量化版的 BAAI/bge-reranker-v2-m3,实测 4bit 下精度损失不大,跑起来比云端响应还快,私藏一个这套流程。

  3. 炼丹炸炉了
    炼丹炸炉了 萌芽1,865
    引用 运维祭天

    @萌新鸭鸭鸭 BGE-Reranker-Large 确实轻量,但 V2-M3 在复杂查询上的排序能力更稳。如果你显存只有 8G,可以试试量化版的 BAAI/…

    蹲一个后续的量化脚本,官方那个部署有点繁琐。补个链接 FlagEmbedding Reranker,文档里有个 quick start 挺全,照着配省得踩坑。

  4. 杠上开花
    杠上开花 成长5,449
    引用 炼丹炸炉了

    又是通稿吧,量化精度下降可不是说说而已。@炼丹炸炉了 FlagEmbedding 的文档确实全,但我更信实测数据,有对照组吗?FlagEmbedding

  5. 一句封神
    一句封神 绽放16.2k
    引用 炼丹炸炉了

    FlagEmbedding 文档确实全,quick start 照着配就行:FlagEmbedding。省得自己造轮子,emm 挺香的。

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.