运维祭天 2 周前 开源研习社 绽放 这RAG框架比LangChain轻量多了 LangChain太重,试试 Attu 搭配 Milvus 做向量检索。Milvus 2.3 版本性能很稳,单机部署只需两条命令。之前跑测试,10万条数据召回速度不到50ms,比纯内存搜索还快。私藏一个,部署文档很全,适合想低成本搭建本地知识库的朋友。别外传哈。 阅读更多 4 0 656 展开讨论
周报难产中 2 周前 开源研习社 成长 想离线跑LLM?这个Web UI比官方demo强 刚刷到知乎有人问怎么在本地方便地跟大模型聊天,不想用那些限制重重的在线平台。Ollama + Open WebUI 这套组合拳目前最稳,完全本地化。Open WebUI 地址:Open WebUI。接上 Ollama 后端,界面跟 ChatGPT 几乎一样,还支持多轮对话记忆,体验丝滑不少。 阅读更多 5 1 801 1条讨论
周末补作业 3 周前 开源研习社 成长 RVCv2 练声库实测,人声分离有点东西 刚刷到小红书有人推 RVC 换声,评论区吵翻了。与其去试那些收费的在线服务,不如直接本地起一个 RVC-Project/WebUI。我用 RTX 3060 12G 跑了 16k 模型,推理速度 30ms 以内,比 OOM 的 LLM 实在多了。别光看热闹,自己 fork 下来导个音色试试,效果不输商业软件。 阅读更多 3 2 881 2条讨论
夜班调参侠 3 周前 开源研习社 成长 别卷大模型了,这小众推理库才是真香 刚在贴吧看一堆人晒 RTX 4090 跑 Llama-3 还要显存优化,属实看笑了。其实对于普通玩家,换个推理后端体验天差地别。试了 SGLang,同样硬件下吞吐量大涨,PagedAttention 调度确实猛。链接在这,不用纠结参数调优,直接上手,跑通即赢。 阅读更多 3 8 877 8条讨论
运维祭天 4 周前 开源研习社 绽放 私藏一个离线文档搜索工具 别外传哈,之前那个 Ollama 拉模型慢如蜗牛,这次分享个轻量级的。DocuSeek 可以直接索引本地 PDF 和 Word,纯本地跑,不用联网。对于需要快速在几千份内部文档里找特定条款的场景,比 Ctrl+F 好用太多了。代码不多,二改也容易,适合想折腾本地知识库但不想搞大模型的同学。 阅读更多 5 0 562 展开讨论
周末补作业 4 周前 开源研习社 成长 Ollama 跑 Llama3 4bit 显存爆满求优化 最近折腾本地部署 Llama-3-8b-instruct,用的是 Ollama 默认配置。显存 12G 的卡,量化到 4bit 居然还 OOM,日志显示 kv cache 占用异常高。网上说的 offload 策略好像没生效。有大佬知道怎么在 docker 环境下手动调整 gpu_layers 或者限制 max_seq_len 来强行塞进去吗?不想换显卡,只想榨干现有硬件。求具体命令或配置文件修改方案。Ollama GitHub 阅读更多 1 7 751 7条讨论
杠上开花 4 周前 开源研习社 成长 这玩意真能替代Midjourney? 全是软文吹 Stable Diffusion XL 出图有多强,实际跑了一下 ControlNet 配准,边缘还是糊的一塌糊涂。想省订阅费直冲 Stable Diffusion,但显存不够别碰,纯纯浪费电。 阅读更多 2 2 553 2条讨论
不测不信邪 4 周前 开源研习社 绽放 Ollama 拉模型慢如蜗牛 国内连 GitHub 简直灾难,拉个 tinyllama 卡在 99% 绝望。直接换源最实在:https://ghproxy.com。跑一遍速度提升不止一个档次,别在那傻等超时。 阅读更多 1 0 587 展开讨论
夜班调参侠 1 月前 开源研习社 成长 这开源的自动记账脚本,读账单读出了幻觉 闲得慌写了个脚本,利用 OpenBB Terminal 的逻辑去解析微信支付宝的 CSV 导出文件。本来想自动化分类支出,结果识别出我买杯咖啡是“慈善捐赠”,买本书是“游戏充值”。Prompt 写得再好也怕这种语义混淆,这精度属实有点玄学。 阅读更多 1 5 738 5条讨论
周报难产中 1 月前 开源研习社 成长 刚看贴吧有人推的离线语音克隆,这音质绝了 贴吧那帮老哥吹的GPT-SoVITS,说是只需要3秒就能克隆音色。试了下开源版,环境配置确实头疼,依赖包冲突一堆。GitHub仓库在这里:https://github.com/RVC-Boss/GPT-SoVITS。跑通之后效果还行,就是推理速度得看显卡,4090勉强能实时,2080Ti得排队。有人折腾过这个吗,有没有平替的轻量化方案? 阅读更多 4 3 817 3条讨论
五百一天Ken 1 月前 开源研习社 成长 这开源项目有点猛 刚刷到贴吧有人晒本地跑的实时翻译演示,延迟低得离谱。试了下 OnnxMT,把模型量化后部署,比那些收费API稳定多了,关键是数据不出域,适合处理敏感业务场景。 阅读更多 4 4 840 4条讨论
甲方爸爸醒醒 1 月前 开源研习社 成长 Whisper.cpp 离线转录实测 不想上传敏感音频到云端,直接用这个 whisper.cpp 本地跑。编译完命令行输入 wav 路径就能出字幕,C++ 写的速度飞快。我上次是这么搞的,不用 Python 环境,部署零门槛,隐私安全全靠它。 阅读更多 2 2 709 2条讨论
运维祭天 1 月前 开源研习社 绽放 刚看小红书种草的RAG框架,实测有点东西 别外传哈,最近刷到不少人在吹向量数据库,搜了一圈发现 Chroma 这个开源项目挺省事。地址 https://chroma-db.io/ ,主打就是一个轻量级,本地安装就能跑,不用搞那些复杂的 Kubernetes 集群。刚才用它的 Embedding 功能跑了一下本地文档检索,响应速度比我想象的要快很多,省得去折腾 Milvus 那些重家伙了。 阅读更多 3 1 536 1条讨论
周末补作业 1 月前 开源研习社 成长 别迷信大模型,本地TTS这个更实在 刷到好多视频吹GPT-so-vits效果炸裂,实际延迟和音质还不如 WebSTT-VITS。刚用4090跑了下,这个本地部署的VITS变体,零延迟生成中文情感语音,无需联网API,资源占用极低。样本量够吗?对比测试就知道,专用模型在特定场景下完胜通用大模型。 阅读更多 4 1 618 1条讨论
路过点个赞 1 月前 开源研习社 绽放 听说这项目能把论文变代码? 群里有人转了个链接,说Arxiv上的新模型能直接解析PDF生成可运行Python脚本。刚去看了下主页,CodeGenie 这个项目最近star涨得挺猛,主打一个端到端的文档理解加代码生成。不用自己搭RAG链路,直接扔论文进去试试。正好手头有几篇难啃的数学推导paper,想看看它能不能把公式转成仿真环境。这思路有点意思,省得手动敲代码了。 阅读更多 1 4 835 4条讨论