跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

Parler-TTS:开源语音合成,几行代码生成自然语音

做语音总被困在在线 API 的限速和账单里?Parler-TTS 让多说话人语音合成真正跑在本地,Hugging Face 出品,Apache-2.0 许可证,对开发者、内容创作者和语音研究者都很友好,不需要订阅任何云服务。核心看点- 低成本复刻音色:用 5 秒左右的音频样本描述说话人,即可生成接近目标音色的语音,支持继续微调,打造专属声线。 - 可控制风格与语速:通过自然语言描述控制情感、停顿、语速等细节,比普通 TTS 硬编码参数更加直观,适合做有声书、视频配音。 - 训练推理代码一体:仓库内置数据预处理、训练、推理全流程,社区已有大量微调教程,拿来改造并不难。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示建议准备一张 16GB 显存的 GPU,Python 3.10 以上即可运行。不需要任何 API Key,模型权重全部开放在 Hugging Face Hub,首次运行会自动下载。注意 README 中对音频采样率、时长等格式要求,先跑示例再换自己的数据。对语音克隆或可控 TTS 感兴趣的话,去仓库看示例音频和微调脚本,很快能体验复刻加改写的完整流程。传送门:Parler-TTS GitHub 仓库

GitHub项目

DeepSeek-Coder-V2:开源最强代码大模型,推理与生成双提升

如果你正在寻找一款在代码生成、推理和修复上能媲美甚至超越 GPT-4 的开源模型,DeepSeek-Coder-V2 值得立刻点开。它基于 MoE 架构,在 HumanEval、LiveCodeBench 等基准上表现亮眼,且支持 128K 上下文,非常适合处理复杂代码库或长程推理任务。无论是个人开发者还是团队,都能用它加速编码或搭建本地代码助手。核心看点- MoE 架构与超长上下文:采用混合专家模型,在保持高效推理的同时,支持 128K 上下文窗口,可一次性处理大型代码文件或跨文件依赖分析。 - 多语言与多任务覆盖:在 Python、Java、C++、JavaScript 等主流语言上表现优异,同时具备 代码生成、补全、修复和解释 能力,甚至能处理数学推理和通用问答。 - 开源权重与商业友好许可:模型权重以 Apache-2.0 许可证 发布,可自由用于商业项目,社区已有基于它构建的插件和工具链。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示推荐在 8GB 以上显存 的 GPU 上运行量化版本(如 4-bit),或直接通过 Hugging Face 的 Transformers 库加载。无需额外 API Key,下载权重即可本地部署。如果你更关注推理速度,可以配合 vLLM 或 llama.cpp 使用。想体验最新代码模型的能力边界?前往仓库查看模型卡、示例代码和社区贡献的部署方案,或许能直接解决你手头的编码难题。立即探索 DeepSeek-Coder-V2。

GitHub项目

Krita AI Diffusion:不用切窗口,在画布里直接生成和重绘

画图的人大概都有过这种体验:出图在 ComfyUI,修图在 PS,图层和参数倒来倒去,一张图没画完先在软件之间走了一圈。Krita AI Diffusion 想解决的就是这件事——它把生成、重绘、扩图全塞进 Krita 的画布,笔刷和「AI 笔刷」在同一个界面里切换。插画师、漫画作者,以及想给自己的绘图流程接上模型的开发者,都值得点开看看。核心看点- 画布内直接出结果:选区生成、局部重绘、外绘扩展、放大细化都在同一个窗口完成,配合实时绘制的模式,笔还没提起来就能看到反馈。 - 复用 ComfyUI 做后端:采样器、ControlNet、LoRA 都交给 ComfyUI 节点跑,不必再学一套新配置;本地机器或局域网里的另一台显卡机器都能挂上去。 - 对线稿和分镜友好:线稿上色、草图细化、风格迁移这些漫画流程里最费时间的环节,可以按自己的习惯做成固定工作流反复调用。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合有本地显卡、平时就用 Krita 画画的人:需要 Krita 5.2 以上的版本,外加一个能正常工作的 ComfyUI 后端,纯 CPU 跑体验会很差。也可以连远程或云端的 ComfyUI,代价是延迟看网络。插件本体走 GPL 系许可证,但模型权重和各类 LoRA 的授权各不相同,下载前请以各自的 LICENSE 为准。安装步骤、快捷键和最近几个版本的改动,README 和 Releases 里都写得比较细,想动手的话先翻一遍再装:Krita AI Diffusion 仓库

GitHub项目

EmotiVoice:网易开源的中文情感语音合成,多音色带情绪

如果你在用TTS做有声内容、游戏配音或者虚拟助手,一定遇到过声音“没感情”的尴尬。网易有道开源的EmotiVoice直接瞄准这个痛点,一套模型能生成带有喜怒哀乐等多种情绪的中文语音,并且支持音色混合,开发者调个API就能集成。核心看点- 情感控制直观:通过提示词(如 happy、sad)或参考音频直接指定情绪强度,不像传统TTS只能靠调整语调参数盲猜。 - 多音色 + 方言支持:预训练模型覆盖常见中文口音和数十种音色,用少量数据就能暖启动新角色。 - 推理速度快:基于Transformer的流式架构,在消费级GPU上就能实时合成,项目用MIT许可,可免费用在商业项目里。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示适合需要高质量中文语音合成的游戏开发者、内容创作者以及做有声辅助功能的团队。建议用Python 3.9+,一块显存8G以上的N卡启动官方脚本;如果只想快速试听,Hugging Face上有在线Demo。自定义音色需要准备几段干净的人声素材。更多的技术细节、模型权重和微调脚本都在仓库里,点开 EmotiVoice on GitHub 可以直接体验。

GitHub项目

Langflow:可视化拖拽搭建 RAG 与 Agent 工作流的低代码神器

如果你厌倦了手写长串 Python 代码来串联 LLM 调用、向量库查询和工具链,Langflow 让你像搭乐高一样拖拽节点就能完成从 RAG 到多 Agent 编排的复杂流程。它特别适合快速原型验证、教学演示以及非深度开发者快速上手 AI 应用开发。核心看点- 可视化节点编排:内置 LLM、Prompt、Vector Store、Tool、Agent 等数十种模块,支持自定义 Python 函数节点,拖拽连线即可构建管道。 - 原生 RAG 与 Agent 支持:可直接接入 Chroma、FAISS、Pinecone 等向量库,配合 LangChain 生态实现文档问答、工具调用链,无需手写中间胶水代码。 - 一键导出与 API 部署:工作流可导出为 JSON 或直接启动为 REST API 端点,方便集成到前端应用,项目采用 Apache-2.0 许可证,社区活跃。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁- AI 应用原型设计师:快速验证 RAG 流程或 Agent 逻辑,无需从头搭框架。 - 教学与演示场景:用可视化界面向学生或客户展示 LLM 调用链、检索增强和工具调用过程。 - 低代码爱好者:熟悉 Python 基础即可,无需深度学习框架经验,本地运行仅需 Python 3.8+。快去仓库看看示例工作流和内置模板,拖拽几下就能跑通一个带记忆的聊天机器人——Langflow 仓库主页 的 README 里就有快速启动指南。

GitHub项目

Whisper:OpenAI 开源语音识别,本地部署准确率超乎想象

如果你正在找一个能离线、精准识别多种语言的语音转文字方案,OpenAI 开源的 Whisper 几乎是最省心的选择。它不需要联网,不依赖第三方 API,直接用模型在本地跑,尤其适合开发者集成到自己的应用或研究语音场景。核心看点开箱即用的多语言支持:Whisper 训练数据覆盖近百种语言,对中文、英文等主流语种识别效果接近人类水平,还能自动检测语言并翻译成英文。 模型体积灵活可选:从 tiny(约 1GB 显存)到 large(约 10GB 显存)共 5 个尺寸,笔记本 CPU 也能跑最小模型,GPU 则获得实时速度。 MIT 许可证,社区生态完善:官方提供 Python 包和 CLI 工具,社区衍生出了 whisperX、faster-whisper 等加速方案,生产环境落地很方便。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁做语音笔记、会议转录、视频字幕生成的个人开发者;需要离线语音理解能力的嵌入式或边缘设备研究者;以及想微调语音模型但缺高质量基座的研究团队。Whisper 直接 pip install 就能用,不强制 GPU,对 Python 3.8+ 友好。更详细的安装步骤、模型下载说明和多语言用法,建议直接去仓库的 README 里扫一遍,里面有完整的参数表和示例代码——点此直达 OpenAI Whisper 主页。

GitHub项目

InstantID:一张照片秒级生成风格化肖像,无需额外训练

厌倦了为生成一张特定风格的肖像照而反复调试 LoRA 或等待漫长的 Dreambooth 训练?InstantID 让你仅用一张参考照片,就能在几秒内生成保持身份特征(ID)的多种风格肖像,效果自然、无需额外微调。适合需要快速生成个性化头像、虚拟角色或创意素材的开发者与创作者。核心看点- 零训练,即插即用:基于预训练的 Stable Diffusion 模型,无需 LoRA 或 DreamBooth 训练,一张参考图即可完成身份保持的图像生成。 - 高保真身份保留:通过创新的 IdentityNet 结构,同时利用面部嵌入和关键点信息,在风格大幅变换时仍能稳定保留面部特征。 - 风格兼容性强:支持与 ControlNet、IP-Adapter 等主流扩散生态工具协同,可结合不同风格 LoRA 或提示词实现多样化的肖像效果。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁AI 图像应用开发者 可快速集成个性化生成功能;设计师与内容创作者 需要为人物生成不同风格(如赛博朋克、古风、插画)的肖像素材;研究者 可参考其身份保持机制进行二次探索。依赖 PyTorch 与 Diffusers 库,推荐使用 GPU(显存 ≥ 8 GB)以获得流畅体验。想快速跑通体验?直接看 README 的“Quickstart”部分,或去 Hugging Face 在线 Demo 试试。更多技术细节与社区案例,欢迎访问 InstantID GitHub 主页。

GitHub项目

MiniCPM-V:端侧多模态新选择,手机也能跑高精度识别

做多模态应用时总被模型体积和显存卡住?想找个能离线跑、中文理解又好的开源模型,MiniCPM-V 值得放进收藏夹。它把视觉大模型压缩到手机级别,适合想快速上手端侧多模态能力的开发者和研究者。核心看点端侧部署友好:支持量化推理和常见加速后端,模型规模控制得当,普通笔记本或中端手机也能尝试,不一定要高配 GPU。 多任务覆盖:从图片问答、OCR 到视频理解都有对应能力,能直接对接现实业务,不是只停留在论文里的 demo。 中文生态友好:社区中文讨论活跃,训练数据对中文场景明显倾斜,调试时碰到的坑更容易搜到解决方案。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁如果你在做移动端识别、智能硬件或边缘视频分析,可以把 MiniCPM-V 当基线模型;也适合想研究多模态模型如何落地的同学。项目采用宽松开源许可,但各版本权重具体条款以仓库 LICENSE 为准。想摸清模型能力边界和部署细节,直接看 README 里的演示与文档,再翻翻 Discussions 里大家踩过的坑,比自己盲试快得多——MiniCPM-V 仓库主页 已经帮你把路铺好了。

GitHub项目

llamafile:把大模型打包成单文件,双击就能跑

跑本地大模型是不是总要先装 Python、配 CUDA、再拉一堆依赖?llamafile 把模型权重和推理引擎全部塞进一个可执行文件,双击或一条命令就能启动,适合想快速体验本地模型的开发者,也适合要把模型分发给非技术用户的场景。核心看点- 单文件分发:一个文件同时包含模型和运行时,Linux、macOS、Windows 都能直接执行,省去环境配置的折腾。 - 格式兼容广:支持 GGUF 以及 Llama、Phi、Mistral 等主流架构,命令行里 -m model.llamafile 即可加载,模型文件后缀统一为 .llamafile。 - 自带 Web 聊天界面:启动后自动打开浏览器可视化对话页,无需额外搭前端,同时还提供 OpenAI 兼容 API,方便接入现有工具。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁面向想逃开环境配置的本地推理玩家,以及希望把模型作为独立程序交付给同事或客户的人。CPU 也能跑小尺寸量化模型,不强制要求 GPU;Apache-2.0 许可,个人使用和二次修改都比较自由,具体以仓库 LICENSE 为准。想看看有哪些现成模型可以直接下载体验,或者了解怎么把自己的 GGUF 模型打包成单文件,建议直接逛 README 和 Releases 里的示例资源:Mozilla-Ocho/llamafile

GitHub项目

LightRAG:把知识图谱塞进 RAG,检索又快又省 Token

做 RAG 的人大多踩过同一个坑:文档一多,检索要么召回不准,要么把大段原文硬塞进上下文,Token 烧得心疼。LightRAG 想解决的就是这件事——它把知识图谱的思路压进一套轻量实现里,让你用一台普通机器也能跑出「有关系、有层次」的检索效果。做企业知识库、文档问答、Agent 记忆层的开发者,值得点开看一眼。核心看点图结构与向量双路检索:既做实体关系抽取,也保留向量召回,问「谁和谁有关系」这类问题不再靠运气。增量更新:新文档进来可以只补增量,不必整库重建索引,日常维护成本低。接入门槛低:官方提供 Python SDK 与 API Server,能挂 Ollama 或 OpenAI 兼容接口,存储层可接 Neo4j、PostgreSQL 等,还配了 Web UI 方便先试手感。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示最省事的路径是先 pip 安装,指向一个本地或云端的模型服务跑一遍示例数据,再换成自己的文档。需要注意:实体抽取质量很大程度取决于你选了哪个 LLM,小模型跑出来的图会比较稀疏;仓库采用 MIT 许可证,商用相对宽松,但所依赖的模型权重与三方服务条款仍需以各自 LICENSE 为准。细节和最新改动建议直接看仓库 README 与 Releases,里面有完整配置项和示例脚本。去 LightRAG 仓库翻翻

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.