跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

Quivr:用RAG打造你的第二大脑,私有知识库开源方案

如果你厌倦了把文档喂给ChatGPT后每次都要重复上传,或者担心数据隐私泄露,那Quivr值得你花两分钟看看。它是一个开源的“第二个大脑”,让你用本地或云端LLM构建私有RAG知识库,直接上传PDF、Markdown、代码文件甚至网页链接,就能像聊天一样检索内部信息。无论是个人笔记管理还是团队内部文档问答,都能用上。核心看点- 即插即用的RAG体验:内置文档解析、向量化存储与检索,支持Ollama、OpenAI等多种模型后端;无需手动写Embedding或向量库配置。 - 多模态输入与权限控制:不止文本,还可以拖入图片、音频(需模型支持),并提供简单的用户/群组权限,适合小团队协作。 - 数据完全自主可控:支持本地部署,用PostgreSQL + Supabase存储向量,无需把数据送进第三方SaaS,满足隐私偏好。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁知识工作者、研究人员、小团队,或任何想将散落文档按语义组织起来的人。依赖Docker、Node.js,可自托管;若使用本地Ollama无需API Key,若用OpenAI则需自己的Key。MIT许可证,放心商用。上手不难:克隆后执行docker compose up,浏览器打开后台,上传文档即开始问答。更详细的使用技巧可以看看仓库的README和官方文档,社区也在Discord里活跃答疑。快去Quivr仓库里点个Star,给你的知识库加个AI引擎吧。

GitHub项目

ChatTTS:开源语音合成黑马,自然对话级 TTS 引擎

如果你正在找一款能生成自然对话语气的 TTS,或者想为 AI 助手、播客内容配上更像真人的声音,ChatTTS 值得立刻关注。它专为对话场景设计,支持细粒度控制笑声、停顿、语气词,合成效果在自然度上明显优于传统拼接式或参数式 TTS,而且完全开源、可本地部署。核心看点- 对话级自然度:模型在大规模对话数据上训练,能自动生成“嗯”“啊”等语气词和恰当停顿,听感接近真人聊天。 - 细粒度控制:通过输入特定的音素标签或韵律标记,可精确调节语速、笑声强度、情感倾向,适合需要定制声音表现的场景。 - 轻量部署:模型权重约 1.5GB,支持 GPU 和 CPU 推理,Python 调用只需几行代码,也提供了 Gradio 交互界面。适合谁▲ github.com(阿里云通义万相生成配图,非网页截图)- 想做 AI 语音助手、有声读物或播客生成的内容创作者和开发者。 - 需要为虚拟角色、游戏 NPC 赋予自然声音的爱好者或小型团队。 - 对语音合成技术感兴趣,希望研究或微调 TTS 模型的研究者。使用前需在 Hugging Face 同意模型许可证并下载权重;推荐有 4GB+ 显存的 GPU 以获得实时推理速度。项目采用 MIT 许可证(但模型权重另有协议),社区活跃,Issue 区有大量调参技巧。直接去仓库体验在线 Demo 或看 README 的快速开始,也许你会立刻用它生成一条语音笔记:ChatTTS on GitHub

GitHub项目
最新

kotaemon:开箱即用的 RAG 文档问答,支持本地模型

手上攒了一堆 PDF、论文和内部资料,想直接对话式提问,又懒得从零写切分、检索、重排那一整条链路?kotaemon 就是冲着这个场景做的:它把 RAG 的脏活累活收进一个能直接跑起来的问答界面,开发者和重度文档用户都能少折腾几轮。核心看点- 问答开箱可用:把文档丢进去就能提问,回答会标出引用来源,能翻回原文对应片段核对。 - 检索不只靠向量:支持全文与向量混合检索,并可挂重排模型,比单纯 embedding 检索的命中更稳一些。 - 模型随便换:云端 API 和本地推理服务(Ollama、vLLM 这类)都能接,还带多用户与信息抽取类的进阶流程。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合想快速验证「文档 + 大模型」产品形态的开发者,以及要求数据不出内网的小团队。跑起来一般需要 Python 环境和 Docker,接云端模型要自备 API Key;纯本地跑的话,显存和机器配置得自己掂量。许可证为 Apache-2.0,商用前建议对照仓库 LICENSE 再确认一遍。想判断它到底能撑到什么程度,翻 README 的安装步骤和界面截图最直观,Discussions 里也有别人踩过的坑。去 kotaemon 仓库看看

GitHub项目

LobeChat:一站式多模态聊天与Agent编排平台

厌倦了在多个AI服务之间来回切换?LobeChat是一个开源、可自托管的智能聊天平台,整合了GPT-4、Claude、Gemini等主流大模型,并支持文生图、语音对话、插件系统与自定义Agent。无论是开发者想快速搭建私有助手,还是爱好者追求更灵活的AI交互体验,它都能大幅降低门槛。核心看点- 多模型统一接入:内置数十种模型提供商(OpenAI、Anthropic、Google、国产模型等),无需手动配置API,一个界面即可切换对话引擎。 - 插件与工具链:支持联网搜索、代码执行、图片生成等插件,Agent可自主调用工具完成复杂任务,RAG能力通过知识库插件扩展。 - 优雅的对话体验:支持Markdown渲染、代码高亮、语音输入/输出,以及多模态内容(图片、文件)的拖拽交互,界面接近商业产品。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 希望统一管理多个AI API的开发者,或需要为团队搭建内部AI工作台的技术负责人。 - 对AI Agent和工具调用感兴趣的研究者,可基于其插件系统快速验证想法。 - 依赖:Node.js 18+,可一键Docker部署;使用自带模型需API Key,部分插件(如联网搜索)需额外配置。快去仓库的Releases和插件市场逛逛,看看如何定制你自己的AI工作流:LobeChat GitHub仓库

GitHub项目

DeepSeek-Coder-V2:开源最强代码大模型,推理与生成双提升

如果你正在寻找一款在代码生成、推理和修复上能媲美甚至超越 GPT-4 的开源模型,DeepSeek-Coder-V2 值得立刻点开。它基于 MoE 架构,在 HumanEval、LiveCodeBench 等基准上表现亮眼,且支持 128K 上下文,非常适合处理复杂代码库或长程推理任务。无论是个人开发者还是团队,都能用它加速编码或搭建本地代码助手。核心看点- MoE 架构与超长上下文:采用混合专家模型,在保持高效推理的同时,支持 128K 上下文窗口,可一次性处理大型代码文件或跨文件依赖分析。 - 多语言与多任务覆盖:在 Python、Java、C++、JavaScript 等主流语言上表现优异,同时具备 代码生成、补全、修复和解释 能力,甚至能处理数学推理和通用问答。 - 开源权重与商业友好许可:模型权重以 Apache-2.0 许可证 发布,可自由用于商业项目,社区已有基于它构建的插件和工具链。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示推荐在 8GB 以上显存 的 GPU 上运行量化版本(如 4-bit),或直接通过 Hugging Face 的 Transformers 库加载。无需额外 API Key,下载权重即可本地部署。如果你更关注推理速度,可以配合 vLLM 或 llama.cpp 使用。想体验最新代码模型的能力边界?前往仓库查看模型卡、示例代码和社区贡献的部署方案,或许能直接解决你手头的编码难题。立即探索 DeepSeek-Coder-V2。

GitHub项目
最新

Skyvern:让大模型看懂网页,表单自动化不用再写选择器

网页自动化最烦的地方不是写代码,而是页面一改版,昨天还能跑的脚本今天就报错,接着你又得去翻 DOM 找新的选择器。Skyvern 换了个思路:把「看懂页面」交给大模型和视觉能力,你只描述目标,它自己去定位元素、点按钮、填表单。做爬虫、RPA、内部流程自动化的开发者值得点开看看。核心看点尽量不写选择器:模型同时读取页面结构和截图来定位输入框、按钮,页面做小改动时,流程通常不至于整条报废。一条目标串起整个流程:登录、填表、翻页、下载文件、提取字段可以放进同一个任务,结果能整理成结构化数据。▲ github.com(阿里云通义万相 生成配图,非网页截图)可自托管,有可视化界面:能接多家 LLM 提供方,浏览器里能看到每一步的截图和执行记录,排查问题比翻日志直观。上手提示需要自己准备 LLM 的 API Key,本地部署走 Docker,会拉起 Postgres 等依赖,机器配置别太寒酸。仓库采用 AGPL-3.0,涉及商用或二次分发前请以仓库内 LICENSE 为准。建议先从 README 里最简单的表单任务跑通,再往复杂流程上试。想知道它目前支持哪些模型、最近加了什么能力,直接翻 Skyvern 的 README 与 Releases,那里的更新比二手介绍快得多。

GitHub项目

Wan2.2:MoE 架构的开源视频生成,本地也能跑起来

想在自己机器上做 AI 视频,却总被闭源 API 的排队和额度卡住?Wan2.2 把通义万相的视频生成权重、推理代码和 ComfyUI 玩法一起开源了,做短片、做概念验证的创作者,还有爱折腾本地模型的开发者,都可以直接上手。核心看点最先值得看的是 MoE 架构:把采样过程的高噪声与低噪声阶段交给不同的专家模型,画质和运动连贯性比前代更稳。仓库同时放出了文生视频、图生视频(A14B)和更轻量的 TI2V-5B,后者面向消费级显卡,显存压力友好不少。官方还给出 Hugging Face diffusers 与 ComfyUI 两条集成路径,社区工作流跟得很快,不是丢个权重就完事。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 NVIDIA GPU 和 Python 环境,权重从 Hugging Face 拉取,想省事可以直接照 README 里的 ComfyUI 流程走。注意模型权重有单独的使用条款,动手前先翻一遍仓库 LICENSE,商用场景以官方说明为准。README 里写了安装命令、显存参考和示例提示词,跑通第一条视频应该用不了太久。去 Wan2.2 仓库看看。

GitHub项目

playwright-mcp:让AI用无障碍树操控浏览器,少走截图弯路

想让 Agent 真的会点网页,最常翻车的地方就是截图猜坐标——页面一改版,整段自动化就废。playwright-mcp 换了个路子:把浏览器的无障碍树喂给模型,让它像读文档一样读页面。写后端脚本的、做 Agent 产品的、每天跟后台表单打交道的,都值得点进去看一眼。核心看点不靠像素靠结构:它把 Playwright 的无障碍快照暴露成 MCP 工具,模型看到的是一份带角色和元素引用的清单,点谁、填谁都按引用走,比纯视觉方案稳得多。工具链够日常:导航、点击、填表、上传文件、执行 JS、抓网络请求、截图都收在同一套 MCP 接口里,接上支持 MCP 的客户端就能用。背后是微软:Apache-2.0,更新基本跟着 Playwright 走,Issue 和 PR 都有人接。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示典型用法是让 AI 替你跑重复的网页动作:登录后台导数据、按模板批量填表、做端到端检查。需要 Node.js 环境,用 npx 起服务,然后在 VS Code、Claude Desktop 这类客户端里注册即可;要不要无头、用哪个浏览器频道,都有参数可调。这个服务本身不强制 API Key,真正调模型的是客户端那一侧。第一版建议先在测试站上跑通再引入项目。README 里写了各客户端的配置样例,Releases 也能快速看出最近改了哪块。想先跑通再决定要不要用,直接翻 playwright-mcp 仓库。

GitHub项目

ComfyUI-Manager:一键安装插件,让AI工作流不再碎一地

如果你是 ComfyUI 的重度用户,一定经历过满 GitHub 找插件、手动解压放路径、卡版本冲突的抓狂——ComfyUI-Manager 就是为了终结这种体力活而生的。它像一个官方的插件商店,但更激进:直接在 ComfyUI 界面里完成搜索、安装、更新、卸载,甚至能自动检测依赖缺失并提示修复。对于每天要切换十几种 LoRA 和 ControlNet 的创作者来说,省下的时间就是灵感。核心看点- 浏览器内的插件管理:完全集成在 ComfyUI 的工作台侧边栏,无需进终端、翻 Releases 页面,点几下就能装上最新的节点包。 - 自动更新与依赖检查:每次启动时扫描已安装插件的可用更新,并标记那些缺少 requirements.txt 中包的节点,减少「环境坏了」的排查时间。 - 社区贡献索引:内置一个由社区维护的插件列表,覆盖从动画、视频到 3D 渲染的各种扩展,新手也能快速发现优质资源。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁ComfyUI 用户——无论你是刚装好默认节点的萌新,还是深挖自定义工作流的进阶玩家,这个工具都能让你从复制文件夹的重复劳动里解脱出来。依赖环境需要 Python 3.9+ 和 ComfyUI 本体,仓库基于 MIT 许可,不附带额外 API Key 需求。直接去仓库的 README 看看怎么通过 Git Clone 或者内置安装器快速启用,然后在 Workflow 里试一次安装「ComfyUI-Impact-Pack」这类热门节点,你会回来感谢这个项目的。 ComfyUI-Manager 仓库传送门

GitHub项目

Plandex用AI在终端跑长任务,治好了我的半途而废症

如果你经常打开ChatGPT写代码,却因为对话太长、上下文丢失、需求一变就重来,最后放弃——那Plandex就是为你准备的。它把AI助手直接搬进终端,专门解决“大型、多步骤开发任务”的痛点。无论是重构模块、写测试还是搭脚手架,你只需描述目标,Plandex会自动拆解子任务、按顺序执行、遇到错误自动重试,所有状态持久保存,关了终端下次继续。对命令行老手和AI编程重度用户来说,这套工作流比会话式ChatGPT靠谱太多。核心看点- 任务持久化与断点续跑:所有AI执行状态保存在本地,关掉终端再打开,输入plandex continue就能从上次失败或中断的地方接着干,再也不怕对话被清空。 - 自动任务拆解与分步执行:你只给一个高层面目标(比如“给这个FastAPI项目加JWT认证”),AI会自动拆成多个步骤,每步生成或修改代码,你随时review和调整,像结对编程一样可控。 - 多模型支持与上下文管理:默认集成OpenAI,但可切到Anthropic Claude等;内部用精简的上下文策略避免token浪费,同时保留关键历史,跑大型重构也不会突然失忆。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示装一个Node.js(>=18),然后npm install -g plandex就能开用。无需GPU,不依赖Python环境,对机器配置几乎零要求。首次运行需配一个OpenAI API Key或兼容接口。典型场景:拉下一个新仓库快速理解代码、批量改接口命名、自动给老函数补单元测试。如果你是Vim或Tmux用户,配合起来非常顺手。Plandex的持久化工作流和分步把控的思路,值得每个想把AI真正写进开发流的人试试。去仓库 README 看它怎么拆解一个“邮件发送功能”的例子,很快就能上手:Plandex 仓库

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.