Community · AI Topics
开源研习社
Browse 开源研习社 topics: LLMs, prompts, agents, and AI tool discussions on 芝麻派AI.
Circle posts and replies are in Chinese; click EN at the top for instant browser translation. These pages are not indexed as separate English URLs.
登录后发起讨论
登录即可发布话题,支持配图、表情与手绘,与社区一起交流 AI 实践。
话题分类
开源研习社
刚刷到贴吧有人问AI翻唱咋搞,其实用开源的 GPT-SoVITS 就能实现,仓库在这
https://github.com/RVC-Boss/GPT-SoVITS ,录个几十秒干声就能克隆音色。部署有点折腾,要装 Python 依赖和模型权重,但跟着 README 一步步来就行。跑通之后自己整个语音包,比在线服务省心。
刚在 pyvideotrans 上跑了遍,视频翻译字幕+配音一条龙,用的whisper识别,本地部署后局域网内手机也能访问。识别英文还行,中文翻译后断句偶尔有点怪,但能接受。部署时记得把ffmpeg和模型权重装全,我卡在下载模型那步,最后手动放到指定目录才跑通。反正比在线翻译工具隐私多了。
最近折腾ComfyUI,老是爆显存和节点报错,换了个精简workflow好多了。分享下我用的这个:ComfyUI_examples,官方示例库,各类节点用法都有,照着搭不容易踩坑。另外如果卡在环境依赖,试试这个docker镜像:
https://github.com/WASasquatch/comfyui_docker,省得自己配。
刷到贴吧有人问老电脑能不能跑Stable Diffusion,评论一堆说洗洗睡。其实有轻量开源替代,latent-diffusion,显存要求低,4G也能跑,出图慢点但能用。我这台破笔记本实测能出512的图,挺满意的。
拿 Chroma 给公司一个遗留系统加了本地知识库,用的all-MiniLM-L6-v2嵌入。测试了几个常见问题,召回率能到80%以上,关键部署简单,docker pull就完事。有在类似场景折腾过的吗?
最近想统一管理订阅源,找到 Miniflux,一个极简的 RSS 阅读器,Go 写的,部署超简单。GitHub 仓库:Miniflux。我直接 docker run 就起来了,支持自建、API、离线阅读。不过导入 OPML 后有些源抓不到内容,得手动调下配置。有老哥自建过类似的吗?
离线翻译模型Opus-MT真能打,试了下日中效果不错
最近翻GitHub发现Opus-MT这个项目,一堆小语种翻译模型,本地docker就能跑。试了日译中,比我之前用的在线API还准。仓库在这:Opus-MT,有需要的可以试试。
试了下rembg,u2net模型效果真不错,换证件照不用再花钱去照相馆了。GitHub地址:rembg。安装后用命令行一张一张处理,还能批量。识别背景很干净,头发丝细节也保留得不错。
昨天在旧笔记本上试了llama.cpp,Q4_K_M量化版7B模型,16G内存跑得动。GitHub链接编译完直接调命令行,比装ollama轻量。就是首字生成慢点,大概5秒,但后续token速度能接受。适合不想折腾GPU的。
老哥们说本地跑模型费劲,我蹭了个新开源项目,llama.cpp,直接CPU跑,不用显卡。部署踩了个坑,Makefile报错缺依赖,装个gcc完事。有对照组吗?聊聊还有啥轻量方案。
长辈群转的视频号鸡汤实在看不下去。最近发现个能嫖Google Colab免费GPU跑大模型的脚本——Notion QA,fork下来改个API key就能跑。部署简单:装python依赖,设个notion token,直接query。踩坑是免费显存只够跑7B模型,再大就OOM。
刚在贴吧刷到一堆人问怎么本地搭RAG,正好我实验跑一半摸鱼刷到的,llama_index 最新版支持直接挂本地模型了,不用非得调API。我试了下用llama.cpp跑7B,检索速度还行,就是索引构建那步有点吃内存,16G能扛住。部署文档写挺细,但docker装的时候注意下镜像源,不然慢得要死。
之前为了换证件照背景找了一圈在线工具,不是收费就是压缩画质。GitHub上翻到 rembg,用U2Net模型做人像分割,命令行一行搞定背景色替换。实测白底蓝底都能调,导出分辨率没损失。部署也就pip install,比想象简单。
兄弟萌,刚在GitHub翻到 Opus-MT,一堆小语种翻译模型,直接docker跑。试了日译中,比百度翻译准但慢点。模型文件3-5G,适合有显卡的兄弟。没显卡也能CPU跑,就是等。有没谁用过它那套啥啥语言对?
长辈群刚刷到一堆职场短片,想着能不能用AI批量剪。翻到个开源项目 Video-Retalking,对口型+配音一条龙。部署时卡在模型权重下载,换了镜像才搞定。想省事直接fork了个现成版本,目前能跑但参数调麻了。
Welcome! This site is in Chinese. Tap EN in the top bar to read in English.