跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

用本地模型写代码?Continue 让 VS Code/JetBrains 秒变 AI 搭档

如果你既想享受 AI 编程助手的便利,又不想把代码片段上传到云端,Continue 是目前最成熟的本地方案。这个开源项目让你在 VS Code 或 JetBrains IDE 里直接接入本地推理后端(如 llama.cpp、Ollama),也能连 OpenAI、Anthropic 等云端 API——全凭你选择。项目持续活跃,MIT 许可证,社区已经积累了相当多的插件与配置示例。核心看点- 模型自由:支持 llama.cpp、Ollama、vLLM 等多种本地推理引擎,也兼容 OpenAI 兼容 API,切换只需改一行配置。 - 对话即上下文:选中代码后可直接提问、修改、解释,上下文自动包含相关文件,无需手动复制粘贴。 - 内置 RAG 能力:通过 @codebase 指令自动检索项目内相关代码片段,让大模型理解你的仓库结构。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁日常使用 VS Code 或 JetBrains 的开发者,尤其是对数据隐私敏感、希望离线编程或调试私有代码库的人。需要本地 GPU(或 CPU 推理)来运行模型,若使用云端 API 则需相应 Key。从 README 的快速开始示例出发,几分钟就能搭好第一条对话。更多自定义配置、自定义 Slash 命令和上下文提供器,值得去仓库的 Docs 与 Discussions 里翻一翻。马上体验:Continue 开源编程助手

GitHub项目

Langflow:可视化拖拽搭建 RAG 与 Agent 工作流的低代码神器

如果你厌倦了手写长串 Python 代码来串联 LLM 调用、向量库查询和工具链,Langflow 让你像搭乐高一样拖拽节点就能完成从 RAG 到多 Agent 编排的复杂流程。它特别适合快速原型验证、教学演示以及非深度开发者快速上手 AI 应用开发。核心看点- 可视化节点编排:内置 LLM、Prompt、Vector Store、Tool、Agent 等数十种模块,支持自定义 Python 函数节点,拖拽连线即可构建管道。 - 原生 RAG 与 Agent 支持:可直接接入 Chroma、FAISS、Pinecone 等向量库,配合 LangChain 生态实现文档问答、工具调用链,无需手写中间胶水代码。 - 一键导出与 API 部署:工作流可导出为 JSON 或直接启动为 REST API 端点,方便集成到前端应用,项目采用 Apache-2.0 许可证,社区活跃。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁- AI 应用原型设计师:快速验证 RAG 流程或 Agent 逻辑,无需从头搭框架。 - 教学与演示场景:用可视化界面向学生或客户展示 LLM 调用链、检索增强和工具调用过程。 - 低代码爱好者:熟悉 Python 基础即可,无需深度学习框架经验,本地运行仅需 Python 3.8+。快去仓库看看示例工作流和内置模板,拖拽几下就能跑通一个带记忆的聊天机器人——Langflow 仓库主页 的 README 里就有快速启动指南。

GitHub项目

Kohya’s GUI:训练LoRA模型的全能画布,轻松定制你的SD风格

如果你玩Stable Diffusion,迟早会想训练自己的LoRA——角色、画风或物体,而Kohya's GUI正是开源社区里最受欢迎的图形化训练工具箱。它把SD模型的LoRA、DreamBooth、Textual Inversion训练流程封装成直观界面,省去手写脚本的麻烦,适合想要微调模型的AI绘画爱好者。核心看点- 全流程图形化:从数据打标、配置参数到启动训练,全程在浏览器中操作,初学者也能快速上手。支持自动打标(Tagger)、正则化图像、学习率调度等功能。 - 多后端兼容:底层跑在PyTorch上,支持Windows/Linux,可调用NVIDIA GPU(CUDA)或AMD ROCm。原生集成xformers、DeepSpeed等优化,显存八仙过海。 - 活跃社区与模板生态:仓库持续更新,Issue/PR响应快。网上有大量预设配置文件,你只需改几项路径就能开始训练,大大降低门槛。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合想微调SD风格但不想写训练脚本的AI画师、设计师或爱好者。依赖Python 3.10+和NVIDIA显卡(建议8GB以上显存),可用CPU但会很慢。无需API Key,全部本地运行。许可证为Apache-2.0,可自由使用和修改。打开仓库的Releases页面下载打包版或直接pip install,跟着README里的Quick Start就能跑通第一个LoRA。更多技巧藏在Wiki和Discussions里,很适合逐个探索:Kohya's GUI官方仓库。

GitHub项目

Transformers.js:不用服务器,浏览器里直接跑大模型推理

如果你主要写前端,又想让页面里直接跑模型,这个库值得点开。transformers.js 把 Hugging Face 生态搬到浏览器和 Node.js,不用维护后端服务也能做文本生成、嵌入、分类、语音识别甚至图像分割。核心看点- ONNX Runtime 后端,模型经 Optimum 转换后能离线加载,支持 WebGPU 加速,特定模型在浏览器里能跑出可用的速度。 - API 对齐 Python 版 transformers,熟悉 transformers 的人可以很快迁移;也提供原生 JavaScript 的 Pipeline 接口。 - 覆盖面广,文本、视觉、音频、多模态任务都有示例,社区持续补充新模型。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁前端开发者、独立开发者,以及想给网页加 AI 能力但不想维护 GPU 服务器的团队。依赖 npm 包,模型权重由 Hugging Face Hub 分发,需注意各模型自身的许可证。推理时浏览器需要较新版本以启用 WebGPU,纯 CPU 也能跑,但速度依模型而定。可以先去 README 看支持模型列表,或到官方示例站试试实时效果,再按任务类型找对应 Pipeline。transformers.js 仓库主页 的 Releases 也常有新模型接入说明,值得关注。

GitHub项目

InstantID:一张照片秒级生成风格化肖像,无需额外训练

厌倦了为生成一张特定风格的肖像照而反复调试 LoRA 或等待漫长的 Dreambooth 训练?InstantID 让你仅用一张参考照片,就能在几秒内生成保持身份特征(ID)的多种风格肖像,效果自然、无需额外微调。适合需要快速生成个性化头像、虚拟角色或创意素材的开发者与创作者。核心看点- 零训练,即插即用:基于预训练的 Stable Diffusion 模型,无需 LoRA 或 DreamBooth 训练,一张参考图即可完成身份保持的图像生成。 - 高保真身份保留:通过创新的 IdentityNet 结构,同时利用面部嵌入和关键点信息,在风格大幅变换时仍能稳定保留面部特征。 - 风格兼容性强:支持与 ControlNet、IP-Adapter 等主流扩散生态工具协同,可结合不同风格 LoRA 或提示词实现多样化的肖像效果。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁AI 图像应用开发者 可快速集成个性化生成功能;设计师与内容创作者 需要为人物生成不同风格(如赛博朋克、古风、插画)的肖像素材;研究者 可参考其身份保持机制进行二次探索。依赖 PyTorch 与 Diffusers 库,推荐使用 GPU(显存 ≥ 8 GB)以获得流畅体验。想快速跑通体验?直接看 README 的“Quickstart”部分,或去 Hugging Face 在线 Demo 试试。更多技术细节与社区案例,欢迎访问 InstantID GitHub 主页。

GitHub项目

Plandex用AI在终端跑长任务,治好了我的半途而废症

如果你经常打开ChatGPT写代码,却因为对话太长、上下文丢失、需求一变就重来,最后放弃——那Plandex就是为你准备的。它把AI助手直接搬进终端,专门解决“大型、多步骤开发任务”的痛点。无论是重构模块、写测试还是搭脚手架,你只需描述目标,Plandex会自动拆解子任务、按顺序执行、遇到错误自动重试,所有状态持久保存,关了终端下次继续。对命令行老手和AI编程重度用户来说,这套工作流比会话式ChatGPT靠谱太多。核心看点- 任务持久化与断点续跑:所有AI执行状态保存在本地,关掉终端再打开,输入plandex continue就能从上次失败或中断的地方接着干,再也不怕对话被清空。 - 自动任务拆解与分步执行:你只给一个高层面目标(比如“给这个FastAPI项目加JWT认证”),AI会自动拆成多个步骤,每步生成或修改代码,你随时review和调整,像结对编程一样可控。 - 多模型支持与上下文管理:默认集成OpenAI,但可切到Anthropic Claude等;内部用精简的上下文策略避免token浪费,同时保留关键历史,跑大型重构也不会突然失忆。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示装一个Node.js(>=18),然后npm install -g plandex就能开用。无需GPU,不依赖Python环境,对机器配置几乎零要求。首次运行需配一个OpenAI API Key或兼容接口。典型场景:拉下一个新仓库快速理解代码、批量改接口命名、自动给老函数补单元测试。如果你是Vim或Tmux用户,配合起来非常顺手。Plandex的持久化工作流和分步把控的思路,值得每个想把AI真正写进开发流的人试试。去仓库 README 看它怎么拆解一个“邮件发送功能”的例子,很快就能上手:Plandex 仓库

GitHub项目

LeRobot:让真实机器人学会操作的开源入门套件

想试机器人学习却总被仿真环境劝退?LeRobot 把模仿学习、强化学习打包成可直接跑的 Python 框架,支持真实机械臂,也支持仿真后端。它由 Hugging Face 维护,代码结构清晰,适合想从零接触 Robot Learning 的开发者或研究者。核心看点- 低门槛上手:提供统一 API 和预训练 checkpoint,从数据采集、模型训练到部署开箱即用,不要求自己搭仿真环境。 - 真实硬件支持:针对常见桌面机械臂提供现成配置,官方整理过硬件清单,社区也能共享数据集,生态比想象中热闹。 - 与 Hugging Face 生态打通:数据集和模型都能直接走 Hub,方便复现和协作,还带 Gradio 演示界面,调参更直观。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁对机器人操控刚起步的开发者和 AI 学生最合适。本地跑通需要一台带 CUDA 的 GPU,不过纯推理用小模型也可以 CPU 勉强凑合;不需要额外 API Key,所有资源都是开源开放的。Apache-2.0 许可,商用前建议自己再看一遍 LICENSE。想了解具体支持哪些机器人型号、怎么采数据,直接看 README 的快速开始部分,顺便去 Issues 里瞄一眼社区最近的踩坑记录。仓库入口:huggingface/lerobot

GitHub项目

对话式AI开发利器!NVIDIA NeMo帮你快速构建定制LLM应用

如果你正为如何高效搭建支持多轮对话、知识检索的 AI 应用而头疼,NVIDIA 的 NeMo 框架会是一个值得试试的选择。它专为对话式 AI 场景设计,集成了训练、微调、推理和服务全套能力,对研究者和工程团队都很友好。核心看点- 端到端一站式:从数据处理、模型训练到部署推理,NeMo 提供了统一的工具链,省去拼凑多个库的麻烦。 - 多模态与多语言支持:除了文本对话,还集成了语音识别(ASR)、语音合成(TTS)和图像理解模块,适合构建更自然的交互体验。 - 大规模分布式训练:基于 NVIDIA 的优化,能高效利用多 GPU 集群进行预训练或 LoRA 微调,社区持续在贡献新模型和 checkpoint。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁主要面向有一定深度学习基础的开发者或研究人员,希望快速验证对话式 AI 原型或定制企业级应用。需要 Python 3.8+ 和 CUDA 环境,推荐使用 NVIDIA GPU 以获得最佳体验。框架本身是 Apache-2.0 许可证,模型权重需遵循各自许可。如果你想把 RAG、多模态、语音交互整合到一个相对成熟的工程框架里,不妨仔细翻翻它的 README 和示例,很多细节都在 NVIDIA NeMo GitHub 仓库 里藏着。

GitHub项目

playwright-mcp:让AI用无障碍树操控浏览器,少走截图弯路

想让 Agent 真的会点网页,最常翻车的地方就是截图猜坐标——页面一改版,整段自动化就废。playwright-mcp 换了个路子:把浏览器的无障碍树喂给模型,让它像读文档一样读页面。写后端脚本的、做 Agent 产品的、每天跟后台表单打交道的,都值得点进去看一眼。核心看点不靠像素靠结构:它把 Playwright 的无障碍快照暴露成 MCP 工具,模型看到的是一份带角色和元素引用的清单,点谁、填谁都按引用走,比纯视觉方案稳得多。工具链够日常:导航、点击、填表、上传文件、执行 JS、抓网络请求、截图都收在同一套 MCP 接口里,接上支持 MCP 的客户端就能用。背后是微软:Apache-2.0,更新基本跟着 Playwright 走,Issue 和 PR 都有人接。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示典型用法是让 AI 替你跑重复的网页动作:登录后台导数据、按模板批量填表、做端到端检查。需要 Node.js 环境,用 npx 起服务,然后在 VS Code、Claude Desktop 这类客户端里注册即可;要不要无头、用哪个浏览器频道,都有参数可调。这个服务本身不强制 API Key,真正调模型的是客户端那一侧。第一版建议先在测试站上跑通再引入项目。README 里写了各客户端的配置样例,Releases 也能快速看出最近改了哪块。想先跑通再决定要不要用,直接翻 playwright-mcp 仓库。

GitHub项目

LivePortrait:一张照片让人像动起来,表情驱动开源实现

给一张正面或侧脸照片,再给一段说话或转头的视频,LivePortrait 就能让照片里的脸跟着视频做出眨眼、微笑、歪头这些动作,神态贴合度做得比较自然。它解决了 AI 视频和虚拟人项目里最常见的「图片动起来」难题——不需要 3D 建模,也不用打关键帧,一张图加一个驱动视频就够。对做短视频、数字人、漫画分镜动效的开发者来说,这是可以直接拿去接进工作流的东西。核心看点高精度表情迁移:用隐式关键点同时对嘴型和头部姿态建模,侧脸和夸张表情下依然能保持稳定,生成结果里颈部和头发的跟随也比较顺。训练与推理全公开:项目提供完整训练代码和预训练权重,折腾微调或者只跑推理都有对应文档,不像很多 demo 仓库只放了个空壳。社区生态活跃:已经有人把它接进了 ComfyUI 和直播弹幕互动,意味着你现有的 AI 绘画或视频流程,有机会通过插件直接复用。代码基于 Apache-2.0 发布,模型权重另有条款,动手前先看一眼仓库里的 LICENSE。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示个人开发者用一张消费级显卡就能跑推理,建议先从官方给的示例视频试效果,再换自己的图片。需要 CUDA 环境,推荐用 conda 按 README 建环境;想直接看效果的可以下载模型权重后跑 demo 脚本。如果只是做数字人播报,把驱动视频裁剪成和照片人脸角度接近的比例,效果会更稳。项目主页上有不少演示片段和效果对比,看完再决定要不要往自己的工具链里集成。直接点进仓库看 README 的快速开始: LivePortrait 开源项目

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.