甲方爸爸醒醒 3 月前 开源研习社 成长 Whisper.cpp 离线转录实测 不想上传敏感音频到云端,直接用这个 whisper.cpp 本地跑。编译完命令行输入 wav 路径就能出字幕,C++ 写的速度飞快。我上次是这么搞的,不用 Python 环境,部署零门槛,隐私安全全靠它。 阅读更多 2 2 723 2条讨论
运维祭天 3 月前 开源研习社 绽放 刚看小红书种草的RAG框架,实测有点东西 别外传哈,最近刷到不少人在吹向量数据库,搜了一圈发现 Chroma 这个开源项目挺省事。地址 https://chroma-db.io/ ,主打就是一个轻量级,本地安装就能跑,不用搞那些复杂的 Kubernetes 集群。刚才用它的 Embedding 功能跑了一下本地文档检索,响应速度比我想象的要快很多,省得去折腾 Milvus 那些重家伙了。 阅读更多 3 1 553 1条讨论
周末补作业 3 月前 开源研习社 成长 别迷信大模型,本地TTS这个更实在 刷到好多视频吹GPT-so-vits效果炸裂,实际延迟和音质还不如 WebSTT-VITS。刚用4090跑了下,这个本地部署的VITS变体,零延迟生成中文情感语音,无需联网API,资源占用极低。样本量够吗?对比测试就知道,专用模型在特定场景下完胜通用大模型。 阅读更多 4 1 630 1条讨论
路过点个赞 3 月前 开源研习社 绽放 听说这项目能把论文变代码? 群里有人转了个链接,说Arxiv上的新模型能直接解析PDF生成可运行Python脚本。刚去看了下主页,CodeGenie 这个项目最近star涨得挺猛,主打一个端到端的文档理解加代码生成。不用自己搭RAG链路,直接扔论文进去试试。正好手头有几篇难啃的数学推导paper,想看看它能不能把公式转成仿真环境。这思路有点意思,省得手动敲代码了。 阅读更多 1 4 848 4条讨论
一句封神 3 月前 开源研习社 绽放 想搞个离线版歌词翻译工具,求指点 平时听外语歌喜欢对照歌词,但网页版总有延迟且依赖网络。看到有个开源项目叫 LyricsTranslate (https://github.com/superpikar/lyrics-translate-api,原理很简单,就是抓取歌词然后用大模型翻译。我想自己部署一个纯离线的版本,绑定本地的 Ollama。目前卡在怎么优化长文本翻译的上下文窗口上,怕机器翻译太生硬。有没有大佬搞过类似的本地小工具?主要是想要个无广告、响应快的本地服务。 阅读更多 1 5 791 5条讨论
夜班调参侠 3 月前 开源研习社 成长 挖到个超小众的本地知识库检索库 不想用那些臃肿的大平台,刚找到 LlamaIndex 的极简用法。主打一个轻量,本地部署就能跑 RAG,把 PDF 转向量然后检索,响应速度比我之前用的云服务还快。对于只想要基础功能、不爱折腾大模型的用户来说,这个架构刚刚好,干净利落。 阅读更多 3 10 1,028 10条讨论
不测不信邪 3 月前 开源研习社 绽放 RAG 链路里 Embedding 模型选型纠结 之前一直用 bge-m3,结果跨语种检索效果拉垮。换了 text-embedding-3-large 后,召回率确实有提升,但 API 成本也上去了。正在评估 Qdrant 自带的量化方案能否抵消这部分开销。本地部署的话,MTEB 榜单上免费的 modelscope 开源模型还有谁能打?别光吹 Benchmark,我要看实际业务场景的数据。 阅读更多 5 5 628 5条讨论
周报难产中 3 月前 开源研习社 成长 跑模型被老哥配置坑了 刚在贴吧刷到个老哥求AI跑图配置,底下全是甩单子然后吵起来的。这玩意到底吃显存还是吃CUDA核心?我自己用SD试下来,显存不够直接崩,但有人拿1060跑得飞起,蹲个实际部署过的说说。 阅读更多 2 9 859 9条讨论
运维祭天 3 月前 开源研习社 绽放 有人试过把whisper跑在cpu上吗 贴吧老哥装机贴看多了,自己也想搞个语音转文字玩。捡了台旧笔记本只有CPU,试了openai/whisper那个官方仓库,跑个小文件风扇直接起飞,十分钟才出一行字…后来翻到faster-whisper(github.com/guillaumekln/faster-whisper),说能靠int8量化切到CPU。我照readme搭了个python环境,加载medium模型跑一段30秒的录音,耗时从几分钟缩到40秒左右,总算能用了。有试过更大模型的老哥可以分享下实际体验,看能不能再压一压。 阅读更多 4 8 766 8条讨论
周末补作业 3 月前 开源研习社 成长 llama.cpp能跑视觉模型吗 拉了个llama.cpp最新版,想跑llava-v1.6-7b,结果加载mmproj报错说权重不匹配。有人试过这玩意跑视觉模型没?需要改啥参数还是得换别的后端? 阅读更多 3 6 618 6条讨论
平替猎人 3 月前 开源研习社 成长 ComfyUI 跑 Flux 报错求教 拉了个 ComfyUI 最新版,想跑 Flux.1-schnell,load 模型直接报 Can't load tokenizer for 'flux'。有人碰到过没?还是得手动下别的权重?github.com/comfyanonymous/ComfyUI 阅读更多 5 11 601 11条讨论
夜班调参侠 3 月前 开源研习社 成长 这玩意能跑满显卡吗 刚看到个开源项目叫LocalAI,说是能本地跑LLM不用显卡?链接丢这:github.com/mudler/LocalAI。有人试过没,实测性能咋样,能跟Ollama掰手腕不? 阅读更多 2 9 800 9条讨论
周报难产中 3 月前 开源研习社 成长 Stable Diffusion WebUI 跑图报错求指路 刚在本地搭了 Automatic1111 那个 WebUI,用的 v1.8.0,跑个 512x512 的图直接 OOM 了,我 8G 显存理论上够啊。是不是要调 xformers 或者 --medvram?有没老哥丢个改好的启动参数链接,或者直接贴个稳定点的一键包出来,蹲个后续。 阅读更多 5 9 876 9条讨论
强迫症晚期 3 月前 开源研习社 绽放 有人试过LocalAI没 刚看到LocalAI这玩意,说是可以本地跑LLM和图像生成,不用GPU也行。有人部署过没?链接在这:https://github.com/mudler/LocalAI,docker-compose一键启动,但模型下载那块有点迷,我上次配了半天卡在路径上,有没有踩坑经验分享下? 阅读更多 4 10 547 10条讨论
运维祭天 3 月前 开源研习社 绽放 安利一个能白嫖的本地OCR项目 私藏一个叫PaddleOCR的开源项目,百度出的,GitHub链接:https://github.com/PaddlePaddle/PaddleOCR。部署巨简单,pip install就跑起来,识别合同截图准确率吓人,关键免费,比那些按次收费的云API香多了。别外传哈,踩坑点:如果电脑没GPU,记得加参数--use_gpu false,不然报错卡半天。我自己用来转扫描件成word,省了手动敲键盘的时间,爽。 阅读更多 4 17 369 17条讨论