跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

OpenHands 开源 AI 程序员:Agent 能自己改代码

你是不是也烦透了“AI 只会聊天,但不会干活”?OpenHands 把大模型接进沙箱环境,让 Agent 真正读仓库、写代码、跑命令,而不是只给建议。最适合想用 AI 处理真实 GitHub issue 的开发者。核心看点- 端到端处理 issue:丢给它一个 bug 描述,它会自动分析代码结构、修改文件并执行测试,把活干完。 - 能操作终端和浏览器:不只是改代码,还能运行调试命令、打开网页复现问题,覆盖完整开发闭环。 - 模型自由切换:可以接 OpenAI、Anthropic,也能连本地 Ollama,MIT 许可证让二次开发没负担。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示个人开发者可以把它当作结对编程伙伴;研究者也能用它做 Agent 行为实验。需要 Python 3.11 及以上,推荐 16GB 内存;只想体验的话有在线 demo,跑复杂任务再考虑接入 API Key。想看看它怎么把一个“一句话需求”变成可运行的 PR?直接去 README 翻 demo 视频和架构图,有问题去 Issues 里聊:OpenHands

GitHub项目

LivePortrait:一张照片让人像动起来,表情驱动开源实现

给一张正面或侧脸照片,再给一段说话或转头的视频,LivePortrait 就能让照片里的脸跟着视频做出眨眼、微笑、歪头这些动作,神态贴合度做得比较自然。它解决了 AI 视频和虚拟人项目里最常见的「图片动起来」难题——不需要 3D 建模,也不用打关键帧,一张图加一个驱动视频就够。对做短视频、数字人、漫画分镜动效的开发者来说,这是可以直接拿去接进工作流的东西。核心看点高精度表情迁移:用隐式关键点同时对嘴型和头部姿态建模,侧脸和夸张表情下依然能保持稳定,生成结果里颈部和头发的跟随也比较顺。训练与推理全公开:项目提供完整训练代码和预训练权重,折腾微调或者只跑推理都有对应文档,不像很多 demo 仓库只放了个空壳。社区生态活跃:已经有人把它接进了 ComfyUI 和直播弹幕互动,意味着你现有的 AI 绘画或视频流程,有机会通过插件直接复用。代码基于 Apache-2.0 发布,模型权重另有条款,动手前先看一眼仓库里的 LICENSE。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示个人开发者用一张消费级显卡就能跑推理,建议先从官方给的示例视频试效果,再换自己的图片。需要 CUDA 环境,推荐用 conda 按 README 建环境;想直接看效果的可以下载模型权重后跑 demo 脚本。如果只是做数字人播报,把驱动视频裁剪成和照片人脸角度接近的比例,效果会更稳。项目主页上有不少演示片段和效果对比,看完再决定要不要往自己的工具链里集成。直接点进仓库看 README 的快速开始: LivePortrait 开源项目

GitHub项目

MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型

做 RAG 或拿本地文档微调时,最大的痛点往往是 PDF 排版乱、Word 表格识别难、图片里的文字还要另外 OCR。微软开源的 MarkItDown 把这一串流程收成一条命令:PDF、Word、Excel、PPT、图片、音视频都能转成干净的 Markdown,喂给大模型之前省掉大量手工清洗。特别适合正在搭知识库、做 Agent 数据预处理,或者只是想用 ChatGPT 分析本地文件的朋友。核心看点- 格式覆盖广:Office 三件套、PDF、EPUB、HTML 甚至带文字的视频、音频都能处理,图片可走 OCR 提取文字,算是给 LLM 准备的“万能转马克钉”。 - CLI 与库双形态:既能在终端一行命令转换,也能 from markitdown import MarkItDown 嵌入 Python 脚本,接进 RAG、Agent 的数据管线很顺。 - 扩展机制友好:自带 MarkdownConverter 基类,想接自己的 OCR、ASR 服务或私有解析器都可以,不用等官方更新。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁做 RAG 的知识库工程师、需要给大模型预处理文档的开发者,以及日常整理资料的信息工作者。Python 环境 3.10+ 即可,基础转换在本地完成不需要 GPU;若要用云端 OCR/ASR,可以在配置里接入 Azure 等服务,官网 README 有例子。许可证是 MIT,放心二开。如果你想看完整的支持列表和接入方式,直接翻 README 上的示例,比文档还直观。对了,项目最近还在更新,提 issue 也是有人管的。顺手去 MarkItDown 仓库 点个 Star 备用,下次同事让你解析脏文件时就能拿出来顶上了。

GitHub项目

Letta:给 Agent 装上能自我更新的长期记忆

如果手头的 Agent 总在多轮对话后“失忆”,Letta 值得你点开源码看一眼。它是 MemGPT 的延续,把研究里的“自我编辑记忆”变成可自托管的 Agent 框架,非常适合正在做复杂助手、知识型 Bot 或长期任务的开发者。核心看点- 记忆即代码:上下文按 memory block 组织,Agent 可以通过工具调用自主写入、更新和清理记忆,而不是把所有历史都硬塞进 prompt。 - 开箱即用的运行时:带 REST API 和 Python SDK,配合官方 Server 就能本地跑起来,既接 OpenAI/Anthropic 这类云模型,也能对接本地推理服务。 - Apache-2.0 许可:可以放心自托管和二次开发,仓库近期提交与 Issues/PR 讨论都还算活跃,不是摆样子的空壳。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合被 context window 限制折磨的开发者和想研究 Agent 长期记忆机制的研究者。运行 Letta 需要准备好 Python 环境,服务端可以按 README 说明容器化部署;调用云模型要 API Key,用本地模型则参照你自己部署的推理服务即可。想理解 memory block 到底怎么工作,直接按 README 快速跑一个带记忆的 Agent;想聊架构取舍和后续方向,可以翻 Discussions。先从这个入口进:Letta 仓库

GitHub项目

PEFT:一张显卡也能微调大模型的 LoRA 利器

想微调大模型却总被显存劝退?PEFT 是 Hugging Face 官方出品的参数高效微调库,把 LoRA、Prefix Tuning 这些方法封装成几行代码,让普通开发者也能在消费级 GPU 上折腾大模型。适合刚入门微调、又不想啃论文复现细节的开发者。核心看点- 多种主流方法一套搞定:内置 LoRA、QLoRA、IA3、P-Tuning、Prefix Tuning 等,切换时只需改一个参数,方便横向对比效果。 - 与 transformers 深度集成:直接复用现有模型和 Trainer 生态,训练完导出的小体积权重也能配合推理框架部署,改动量很小。 - 降低微调门槛:训练的额外参数占比通常很低,配合量化还能进一步压显存占用,对个人研究者友好,社区更新也频繁。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁如果你的项目卡在「模型太大、显卡太少」,或者想快速试不同微调策略,这个库会很顺手。需要基础的 Python 和 transformers 使用经验,不需要额外 API Key,模型和权重仍要按原模型许可证使用。项目使用 Apache-2.0 协议,可放心商用。想动手的话,README 里有清晰的快速上手示例,也值得翻一翻 Examples 看真实场景怎么用。直接去 PEFT 仓库主页 逛逛吧。

GitHub项目

DSPy 让大模型提示词工程变可编程,告别手写 Prompt 碎片

还在为几十条 Prompt 维护头疼?试试斯坦福开源的 DSPy——它把「提示词工程」抽象成类似 PyTorch 的声明式模块,用优化器自动调整 Prompt 与权重,而不是靠人肉调词。适合做 RAG、Agent 或多步推理管线的研究者与工程师,能明显减少调试咒语的痛苦。核心看点- 模块化声明式 API:用 dspy.ChainOfThought、dspy.ReAct 等封装推理步骤,用代码组织复杂流程,Prompt 不再散落各处。 - 自动优化器:内置 BootstrapFewShot、MIPRO 等编译器,能从少量示例中自动生成高质量 few-shot 与指令,效果常优于手动设计。 - 多后端兼容:支持 OpenAI、Anthropic、Cohere 以及本地模型(通过 Ollama 等),同一套代码可切换不同 LM,方便对比。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁如果你正在做 RAG 问答、Agent 工具调用或多跳检索,且对结果一致性有要求,DSPy 很值得一试。依赖主要是 Python 与一个可用的 LLM 接口;若用本地模型,需要提前跑起 OpenAI 兼容服务。项目以 MIT 许可发布,社区活跃,文档里有大量示例 Notebook。想快速感受「写 Python 替代拼 Prompt」的体验,直接去看看 DSPy 的 README 与示例,很多模式直接抄就能用。

GitHub项目

DB-GPT:把大模型接进数据库,自然语言秒变 SQL

如果你每天要在数据库和报表工具之间来回切换,写 SQL 写到手酸,DB-GPT 值得你花一分钟点开看看。它把大模型、智能体和数据操作串成一条完整链路,适合做数据分析、BI 场景的开发者或数据工程师,省去手工调查询的重复劳动。核心看点- 自然语言直通数据库:连上 MySQL、PostgreSQL 等常见存储后,用中文描述需求就能生成查询,还能顺手出图表,让数据问答变得很直接。 - 模型适配灵活:底层支持 Qwen、Llama 等开源权重模型,也允许接外部 API,不绑定单一供应商,团队选型更自由。 - 既有界面也有 API:提供可视化面板方便交互,同时暴露服务接口,想集成到自己的系统里也不麻烦,项目以 Apache-2.0 开源,商用前记得过一遍 LICENSE。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁数据分析师、后端开发者,或者想给团队搭一个私有知识库加数据库问答服务的小组。部署上需要能跑开放权重模型的 GPU,也可以走纯 API 模式降低门槛;安装依赖偏向 Python 生态,建议先照着 README 的快速开始跑一遍。想看清完整的模型适配清单和插件玩法,直接进仓库翻文档和示例,打开 DB-GPT 项目主页 慢慢看。

GitHub项目

Meta SAM 2:开源图像分割模型,物体追踪与视频遮罩一气呵成

搞计算机视觉的朋友肯定对 Meta 的 SAM 不陌生,现在它的升级版 SAM 2 来了。这个仓库把图像分割和视频对象追踪融合进了单一模型架构,你只需要点一下或画个框,就能在单帧上分割出物体,然后模型会自动追踪它在视频后续帧中的遮罩。对于需要精细处理视频素材的开发者、研究者来说,这意味着告别传统逐帧标注或分离的图像分割 + 追踪管线。核心看点- 统一图像与视频分割:不再需要两个独立模型。SAM 2 用同样的权重同时处理静态图和动态视频,输出像素级精确的遮罩。 - 交互式与自动模式双管齐下:你可以通过点击、框选或涂鸦给出提示,模型立即响应;也能配合 Grounding DINO 等文本检测器实现“用文字找物体并分割”。 - 推理高效,内存友好:基于 Transformer 的架构设计,对中等显卡(如 RTX 4090)就能流畅跑视频分割,官方提供了多种预训练权重和 ONNX 导出方案。仓库基于 Apache-2.0 许可证开放。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示典型场景包括视频编辑中的对象替换、医学影像病灶追踪、自动驾驶中动态障碍物的实例分割。你需要 Python 3.9+、PyTorch 2.0+,以及至少 16GB 显存的 GPU(建议 24GB 以上跑高清视频)。无需第三方 API Key,所有模型权重可直接从 Hugging Face 下载。安装指令和 Colab 示例都在 README 里写得很明白,半天内就能跑通第一个 demo。更多细节和社区讨论可以到仓库的 Discussions 里翻翻,不少人已经贴出了有趣的视频遮罩用例。如果你对 SAM 2 的实现原理或部署优化感兴趣,不妨直接看 README 中关于模型架构和训练数据的部分,链接在这里:meta sam 2 仓库主页。

GitHub项目

LitGPT:用PyTorch原生方式训练部署LLM,告别框架黑盒

如果你是那种觉得Hugging Face Trainer太黑箱、想自己掌控每一行训练代码的开发者,LitGPT可能是你一直想要的东西。它不是又一个高层封装,而是基于PyTorch Lightning构建的轻量级LLM训练与推理工具,直接暴露模型架构和优化步骤,同时省去重复的模板代码。无论是从头预训练、LoRA微调,还是部署,都用一套熟悉的PyTorch风格搞定,适合喜欢「看得见」训练过程的科研人员和工程师。核心看点- 透明可控的训练流程:使用PyTorch Lightning的LightningModule和LightningDataModule,hparams和checkpoints都按标准结构组织,没有隐式全局变量。支持FSDP、混合精度、梯度检查点等主流优化,配置通过YAML或CLI指定,极易复现实验。 - 原生支持多种模型架构:包括Llama 2、Mistral、Mixtral、Phi-2、Gemma、Qwen等,权重可直接从Hugging Face Hub下载,无需转换。微调支持LoRA/QLoRA、Adapter,且提供最小代码量的脚本,例如finetune/lora.py只有不到200行,适合学习和定制。 - 推理与导出一体化:能在单卡或CPU上跑生成,也支持批量推理;导出为torch.compile、ONNX或Triton推理服务所需格式,部署链路清晰。作者还提供量化方案,方便在边缘设备上运行。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁- 研究者:需要修改模型内部结构、试验新训练策略,LitGPT的模块化设计让你不必重写整套流程。工程师:需要一个可读性强、易于集成到现有CI/CD管线的LLM开发工具,且不想引入太多黑盒依赖。依赖:需要PyTorch 2.1+,CUDA或MPS加速;微调一张A100 80GB可跑7B模型,如果你的显…

GitHub项目

Diffusers 0.33:用统一 API 玩转文生图与视频生成,开发者的新起点

如果你还在为集成 SD、Flux、CogVideoX 等模型而拼凑零散代码,那不妨看看 HuggingFace 的 Diffusers。这个库把主流扩散模型打包成一套简洁的 Pipeline,无论是文生图、图生图还是视频生成,切换模型只需改几行参数。配合 HuggingFace Hub,模型权重和配置文件一键拉取,无需手动搬运。核心看点- 统一的 Pipeline 架构:StableDiffusionPipeline、FluxPipeline、CogVideoXPipeline 等几十种 Pipeline 共享相同调用方式,from_pretrained 加载、.to('cuda') 推理,新手也能秒上手。 - 社区扩展生态丰富:内置 LoRA、ControlNet、IP-Adapter 等热门训练和推理插件,无需改主代码即可实现换脸、姿势控制、风格迁移。官方还持续跟进最新论文,如 FLUX、SD3 首发即支持。 - 训练与微调一站式:提供训练脚本和示例,配合 accelerate 和 diffusers 自带的 train_text_to_image_lora.py,你能在消费级显卡上快速微调模型,并共享到 Hub。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁面向需要快速实验或构建生成式 AI 应用的开发者、研究者和创作者。依赖 Python 3.8+ 和 PyTorch,建议配备 GPU(至少 8GB 显存),但 CPU 推理也可行。所有模型均开源,无需 API Key;使用前请务必确认各模型权重仓库的 LICENSE 条款(部分模型有非商业限制)。Diffusers 不仅是工具箱,更是社区生态的入口。无论是想复现最新论文、做二次开发,还是想自己动手训练个性化模型,这里都能让你少踩不少坑。快去仓库的 README 和示例目录…

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.