跳到内容

下午好,继续加油,离目标更近一步。

GitHub项目

共 114 篇文章

GitHub项目

ChatDev:让AI智能体协作开发,一句话生成完整软件

想用自然语言描述一个想法,然后看到AI智能体自己拆解需求、写代码、修Bug?ChatDev 就是干这个的。它把软件开发流程变成一场多智能体协作——CEO、程序员、设计师各司其职,连续对话后直接产出项目代码,特别适合想折腾 AI 编程、又不想手动拼 Prompt 的开发者。核心看点- 多智能体协作机制:每个角色拥有独立的上下文和任务边界,像真实团队一样分工,需求从拆解到实现一气呵成,比单次 LLM 调用可控得多。 - 端到端生成:从输入一句需求开始,自动生成代码文件、依赖说明甚至运行指引,你拿到的是一个可以直接打开的项目骨架。 - 易扩展与可定制:支持自定义角色、数据存储和后端模型,既可以用云 API,也可以接本地推理服务,改动不算复杂。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示项目以 Apache-2.0 协议开源,仓库里有清晰的快速上手文档。你只需要准备 Python 环境和可用的模型 API Key,不一定需要独立 GPU。建议先把官方示例跑通,再动手改角色设定。生成的代码虽然像模像样,但上生产前依然需要人工检查,把它当成一个高效的结对程序员更合适。喜欢的话,去 ChatDev 仓库 翻翻 README 和示例目录,里面还有不少玩法细节和社区讨论,值得进一步探索。

GitHub项目

Open-Sora 开源视频生成:本地复现 Sora 级效果

Sora 刷屏之后,很多团队都在拆解怎么复现,Open-Sora 是最早把完整流程摊开来的开源实现之一。它适合想上手视频生成训练/推理的开发者,也值得关注扩散模型架构的爱好者围观。核心看点- 完整训练管线:从视频处理、图像编码到扩散 Transformer 训练都有配套脚本,能看清生成背后的每一环,而不是只调黑盒 API。 - 推理与演示开箱即用:仓库提供 Gradio 示例与预训练权重入口,先跑通生成再谈二次开发,节奏很友好。 - 版本迭代快、社区活跃:代码侧采用 Apache-2.0 许可,结构清晰,适合在此基础上改模型或加数据集。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁比较适合想本地调试视频生成模型的研究者,也适合动手能力强的 AI 爱好者。依赖主要是 PyTorch 环境,具体显存和版本要求以 README 为准;注意权重与代码许可不同,商用前要核对。如果想看到实际生成的视频片段,或者想了解训练配置,直接打开 README 里的快速开始和示例页就行;调参经验可以在 Discussions 里翻一翻。Open-Sora 仓库直达

GitHub项目

Langfuse:看穿每一次 LLM 调用,开源可观测性补上调试短板

开发大模型应用最难受的,不是模型不聪明,而是它为什么返回这么个结果。Langfuse 就是解决这个问题的:把你应用的每次 LLM 调用、Prompt、Token 消耗、追踪链路全部记录成可检索的 trace,方便在网页端直接回放排查。做 RAG、Agent、多轮对话的开发者应该都能用上。核心看点- 全链路可观测:从用户侧请求到模型返回,中间经过的检索、工具调用、重试、降级都能串成一条 trace,排查透明了很多。 - 多语言 SDK 接入简单:官方提供 Python/JS/TS 包,能一行代码挂到 LangChain、LlamaIndex、OpenAI SDK 等生态上,不用侵入业务逻辑。 - 自托管 + 开放协议:仓库采用 MIT 许可,支持 Docker 一键部署,数据留在自己的服务器,在意隐私的团队也能安心用。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示想快速感受,先 docker compose up 起一个本地实例,然后在应用里引入 SDK,设置 Langfuse 的 host 和 project key。跑几句测试就能在 dashboard 看到耗时分段和完整输入输出。单机加 Docker 就够,不需要 GPU。建议再翻一遍仓库 README 里的接入示例和 Telemetry 说明:Langfuse 仓库首页。

GitHub项目

PaddleOCR:一行命令搞定中文场景识别,PDF表格文字直接抽

做文档处理的人都知道,把 PDF、截图里的文字和表格变成结构化数据有多费劲。PaddleOCR 是我见过最省心的开源 OCR 项目,装好后一行命令行就能跑,中文识别效果在开源方案里属于第一梯队,特别适合内容创作者、开发者和需要批量处理文档的办公党。核心看点- 开箱即用:提供预训练好的 PP-OCR 系列模型,覆盖中英文、表格结构、版面分析和方向分类,不用自己训练就能处理大多数真实场景。 - 识别 + 结构化一体:不只输出文字框,还能把表格还原成 Excel 格式,对长文档和复杂版面也有专门的解析管线,做 RAG 前处理很顺手。 - 部署灵活:支持 CPU/GPU 推理,有 Python API 和命令行工具,也能导出服务化部署,从脚本调用到线上接口都能接。项目采用 Apache-2.0 许可证,模型权重细节以仓库 LICENSE 为准。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示建议在 Python 环境里直接 pip install paddleocr 和 paddlepaddle,然后传入图片路径就能得到识别结果。不需要 GPU,普通 CPU 跑小图也够快,但批量处理长文档时最好有独立显卡。首次使用会自动下载预训练模型,记得保持网络畅通。想看看新版模型效果、完整模型列表或者是训练自有数据的教程,直接去仓库 README 和文档逛一圈,比你自己慢慢试高效得多:PaddlePaddle/PaddleOCR

GitHub项目

Transformers.js:不用服务器,浏览器里直接跑大模型推理

如果你主要写前端,又想让页面里直接跑模型,这个库值得点开。transformers.js 把 Hugging Face 生态搬到浏览器和 Node.js,不用维护后端服务也能做文本生成、嵌入、分类、语音识别甚至图像分割。核心看点- ONNX Runtime 后端,模型经 Optimum 转换后能离线加载,支持 WebGPU 加速,特定模型在浏览器里能跑出可用的速度。 - API 对齐 Python 版 transformers,熟悉 transformers 的人可以很快迁移;也提供原生 JavaScript 的 Pipeline 接口。 - 覆盖面广,文本、视觉、音频、多模态任务都有示例,社区持续补充新模型。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁前端开发者、独立开发者,以及想给网页加 AI 能力但不想维护 GPU 服务器的团队。依赖 npm 包,模型权重由 Hugging Face Hub 分发,需注意各模型自身的许可证。推理时浏览器需要较新版本以启用 WebGPU,纯 CPU 也能跑,但速度依模型而定。可以先去 README 看支持模型列表,或到官方示例站试试实时效果,再按任务类型找对应 Pipeline。transformers.js 仓库主页 的 Releases 也常有新模型接入说明,值得关注。

GitHub项目

OpenHands 开源 AI 程序员:Agent 能自己改代码

你是不是也烦透了“AI 只会聊天,但不会干活”?OpenHands 把大模型接进沙箱环境,让 Agent 真正读仓库、写代码、跑命令,而不是只给建议。最适合想用 AI 处理真实 GitHub issue 的开发者。核心看点- 端到端处理 issue:丢给它一个 bug 描述,它会自动分析代码结构、修改文件并执行测试,把活干完。 - 能操作终端和浏览器:不只是改代码,还能运行调试命令、打开网页复现问题,覆盖完整开发闭环。 - 模型自由切换:可以接 OpenAI、Anthropic,也能连本地 Ollama,MIT 许可证让二次开发没负担。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示个人开发者可以把它当作结对编程伙伴;研究者也能用它做 Agent 行为实验。需要 Python 3.11 及以上,推荐 16GB 内存;只想体验的话有在线 demo,跑复杂任务再考虑接入 API Key。想看看它怎么把一个“一句话需求”变成可运行的 PR?直接去 README 翻 demo 视频和架构图,有问题去 Issues 里聊:OpenHands

GitHub项目

LivePortrait:一张照片让人像动起来,表情驱动开源实现

给一张正面或侧脸照片,再给一段说话或转头的视频,LivePortrait 就能让照片里的脸跟着视频做出眨眼、微笑、歪头这些动作,神态贴合度做得比较自然。它解决了 AI 视频和虚拟人项目里最常见的「图片动起来」难题——不需要 3D 建模,也不用打关键帧,一张图加一个驱动视频就够。对做短视频、数字人、漫画分镜动效的开发者来说,这是可以直接拿去接进工作流的东西。核心看点高精度表情迁移:用隐式关键点同时对嘴型和头部姿态建模,侧脸和夸张表情下依然能保持稳定,生成结果里颈部和头发的跟随也比较顺。训练与推理全公开:项目提供完整训练代码和预训练权重,折腾微调或者只跑推理都有对应文档,不像很多 demo 仓库只放了个空壳。社区生态活跃:已经有人把它接进了 ComfyUI 和直播弹幕互动,意味着你现有的 AI 绘画或视频流程,有机会通过插件直接复用。代码基于 Apache-2.0 发布,模型权重另有条款,动手前先看一眼仓库里的 LICENSE。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示个人开发者用一张消费级显卡就能跑推理,建议先从官方给的示例视频试效果,再换自己的图片。需要 CUDA 环境,推荐用 conda 按 README 建环境;想直接看效果的可以下载模型权重后跑 demo 脚本。如果只是做数字人播报,把驱动视频裁剪成和照片人脸角度接近的比例,效果会更稳。项目主页上有不少演示片段和效果对比,看完再决定要不要往自己的工具链里集成。直接点进仓库看 README 的快速开始: LivePortrait 开源项目

GitHub项目

MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型

做 RAG 或拿本地文档微调时,最大的痛点往往是 PDF 排版乱、Word 表格识别难、图片里的文字还要另外 OCR。微软开源的 MarkItDown 把这一串流程收成一条命令:PDF、Word、Excel、PPT、图片、音视频都能转成干净的 Markdown,喂给大模型之前省掉大量手工清洗。特别适合正在搭知识库、做 Agent 数据预处理,或者只是想用 ChatGPT 分析本地文件的朋友。核心看点- 格式覆盖广:Office 三件套、PDF、EPUB、HTML 甚至带文字的视频、音频都能处理,图片可走 OCR 提取文字,算是给 LLM 准备的“万能转马克钉”。 - CLI 与库双形态:既能在终端一行命令转换,也能 from markitdown import MarkItDown 嵌入 Python 脚本,接进 RAG、Agent 的数据管线很顺。 - 扩展机制友好:自带 MarkdownConverter 基类,想接自己的 OCR、ASR 服务或私有解析器都可以,不用等官方更新。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁做 RAG 的知识库工程师、需要给大模型预处理文档的开发者,以及日常整理资料的信息工作者。Python 环境 3.10+ 即可,基础转换在本地完成不需要 GPU;若要用云端 OCR/ASR,可以在配置里接入 Azure 等服务,官网 README 有例子。许可证是 MIT,放心二开。如果你想看完整的支持列表和接入方式,直接翻 README 上的示例,比文档还直观。对了,项目最近还在更新,提 issue 也是有人管的。顺手去 MarkItDown 仓库 点个 Star 备用,下次同事让你解析脏文件时就能拿出来顶上了。

GitHub项目

Letta:给 Agent 装上能自我更新的长期记忆

如果手头的 Agent 总在多轮对话后“失忆”,Letta 值得你点开源码看一眼。它是 MemGPT 的延续,把研究里的“自我编辑记忆”变成可自托管的 Agent 框架,非常适合正在做复杂助手、知识型 Bot 或长期任务的开发者。核心看点- 记忆即代码:上下文按 memory block 组织,Agent 可以通过工具调用自主写入、更新和清理记忆,而不是把所有历史都硬塞进 prompt。 - 开箱即用的运行时:带 REST API 和 Python SDK,配合官方 Server 就能本地跑起来,既接 OpenAI/Anthropic 这类云模型,也能对接本地推理服务。 - Apache-2.0 许可:可以放心自托管和二次开发,仓库近期提交与 Issues/PR 讨论都还算活跃,不是摆样子的空壳。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合被 context window 限制折磨的开发者和想研究 Agent 长期记忆机制的研究者。运行 Letta 需要准备好 Python 环境,服务端可以按 README 说明容器化部署;调用云模型要 API Key,用本地模型则参照你自己部署的推理服务即可。想理解 memory block 到底怎么工作,直接按 README 快速跑一个带记忆的 Agent;想聊架构取舍和后续方向,可以翻 Discussions。先从这个入口进:Letta 仓库

GitHub项目

PEFT:一张显卡也能微调大模型的 LoRA 利器

想微调大模型却总被显存劝退?PEFT 是 Hugging Face 官方出品的参数高效微调库,把 LoRA、Prefix Tuning 这些方法封装成几行代码,让普通开发者也能在消费级 GPU 上折腾大模型。适合刚入门微调、又不想啃论文复现细节的开发者。核心看点- 多种主流方法一套搞定:内置 LoRA、QLoRA、IA3、P-Tuning、Prefix Tuning 等,切换时只需改一个参数,方便横向对比效果。 - 与 transformers 深度集成:直接复用现有模型和 Trainer 生态,训练完导出的小体积权重也能配合推理框架部署,改动量很小。 - 降低微调门槛:训练的额外参数占比通常很低,配合量化还能进一步压显存占用,对个人研究者友好,社区更新也频繁。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁如果你的项目卡在「模型太大、显卡太少」,或者想快速试不同微调策略,这个库会很顺手。需要基础的 Python 和 transformers 使用经验,不需要额外 API Key,模型和权重仍要按原模型许可证使用。项目使用 Apache-2.0 协议,可放心商用。想动手的话,README 里有清晰的快速上手示例,也值得翻一翻 Examples 看真实场景怎么用。直接去 PEFT 仓库主页 逛逛吧。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.