跳到内容

晚上好,辛苦一天了,放松一下吧。

GitHub项目

共 114 篇文章

GitHub项目

Mochi 1 开源视频生成:一句提示词生成流畅电影级动态

如果你试过 Sora 但没资格内测,或者被闭源模型的价格劝退,Genmo 开源的 Mochi 1 可能是目前最值得你本地跑一把的视频生成模型。它用 Apache-2.0 许可发布,不需要排队,直接下载权重就能在单卡 A100 上生成 5 秒左右的连贯视频,效果直逼商业方案。核心看点端到端视频扩散:基于 Asymmetric VAE 和 Transformer 架构,直接在 RGB 像素空间生成视频,省去了单独动捕或帧插值步骤。支持 8 秒 540p 的原始分辨率,运动幅度和物体一致性比前代 CogVideoX 更自然。开源权重 + 商业友好许可证:模型权重和推理代码一并放出,MIT 许可证改写和商用限制极少,无论是做独立创作者工具原型还是集成到自家产品,法律风险都很低。▲ github.com(阿里云通义万相 生成配图,非网页截图)社区灵活扩展:官方提供了 Gradio 网页界面和 CLI 两种启动方式。已有开发者尝试 LoRA 微调来控制特定风格,Issues 里也有人在讨论低显存优化(如 FP8 量化)。上手提示建议使用 Linux + Python 3.10,单张 A100(40GB) 即可跑 5 秒视频;如果只有 24GB 显存(如 3090),可以降低帧数量或用官方的蒸馏版模型。权重自动从 HuggingFace 下载,约 10GB。仓库的 README 里贴了现成的 pip install -r requirements.txt 和启动命令,十分钟就能看到第一个 demo。想立刻体验文字到视频的创作快感,直接戳 genmo/mochi 跑起官方脚本,Issues 区还有不少社区调参经验等你挖。

GitHub项目

whisperX:加速Whisper转录并获取词级时间戳,解决语音对齐痛点

还在忍受OpenAI Whisper的原始推理速度?做字幕对齐时手动切分句子的痛苦谁懂?whisperX 直接给你 词级时间戳 + 批量加速,一条命令就能把长音频拆成词级别的字幕,连说话人分离都顺手解决了。适合语音处理开发者、短视频字幕制作者、以及任何需要精准音频时间戳的研究者。核心看点- 基于Whisper的快速推理:通过 batching 和 better memory 管理,在保持精度的前提下把推理速度提升数倍,实测比原版快2-3倍。 - 词级对齐与说话人分离:不需要训练,直接调用 WhisperX 的 pipeline 即可获得每个单词的开始/结束时间,并自动识别不同说话人(需配合 pyannote 模型),省去后期手动校对。 - 简洁API与命令行:pip install 后三行Python代码就能完成转录+对齐,适合集成到自动化工作流;还支持输出 SRT、VTT 等常见字幕格式。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 字幕制作/视频创作者:想要快速生成带时间轴的字幕,无需再手动切分句子。 - 语音识别研究者:需要高精度词级对齐数据用于训练或评估。 - 会议记录/音频分析场景:一条命令搞定多人对话的逐字稿和说话人标签。仓库采用 BSD-2-Clause 许可证,依赖 PyTorch 和 Whisper,建议使用 GPU 获得最佳推理速度。项目维护活跃,Issue 回复及时,社区已经有不少集成案例。想要马上体验词级对齐的快感?直接去 README 看一行示例代码——你只需要打开 whisperX GitHub 主页 复制粘贴就够了。

GitHub项目

Diffusers 0.33:用统一 API 玩转文生图与视频生成,开发者的新起点

如果你还在为集成 SD、Flux、CogVideoX 等模型而拼凑零散代码,那不妨看看 HuggingFace 的 Diffusers。这个库把主流扩散模型打包成一套简洁的 Pipeline,无论是文生图、图生图还是视频生成,切换模型只需改几行参数。配合 HuggingFace Hub,模型权重和配置文件一键拉取,无需手动搬运。核心看点- 统一的 Pipeline 架构:StableDiffusionPipeline、FluxPipeline、CogVideoXPipeline 等几十种 Pipeline 共享相同调用方式,from_pretrained 加载、.to('cuda') 推理,新手也能秒上手。 - 社区扩展生态丰富:内置 LoRA、ControlNet、IP-Adapter 等热门训练和推理插件,无需改主代码即可实现换脸、姿势控制、风格迁移。官方还持续跟进最新论文,如 FLUX、SD3 首发即支持。 - 训练与微调一站式:提供训练脚本和示例,配合 accelerate 和 diffusers 自带的 train_text_to_image_lora.py,你能在消费级显卡上快速微调模型,并共享到 Hub。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁面向需要快速实验或构建生成式 AI 应用的开发者、研究者和创作者。依赖 Python 3.8+ 和 PyTorch,建议配备 GPU(至少 8GB 显存),但 CPU 推理也可行。所有模型均开源,无需 API Key;使用前请务必确认各模型权重仓库的 LICENSE 条款(部分模型有非商业限制)。Diffusers 不仅是工具箱,更是社区生态的入口。无论是想复现最新论文、做二次开发,还是想自己动手训练个性化模型,这里都能让你少踩不少坑。快去仓库的 README 和示例目录…

GitHub项目

Aider:终端AI结对编程,多模型+自动Git提交真香

如果你经常在命令行里写代码,又想让大模型帮你改bug、加功能,Aider值得一试。它把AI助手直接嵌进终端,你只需要用自然语言描述需求,Aider就能读懂项目上下文,替你做编辑,甚至自动生成Git提交——连git commit -m都不用敲。核心看点-全栈上下文感知:Aider会扫描你的仓库结构、文件内容,结合Git历史和对话记忆,理解代码意图再下手改,不是那种“改完跑不通”的盲改。 -模型自由:默认支持OpenAI、Anthropic、Google Gemini等闭源模型,也能切换本地模型(通过Ollama或vLLM)。如果换了模型,整个会话会自动调整角色设定,体验很丝滑。 -天然Git集成:每次AI修改都会自动生成独立commit,方便你用git revert回滚。如果某次改崩了,直接抛弃那个commit就行,心理负担小很多。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示安装只要一行pip install aider-chat,然后在项目目录下运行aider,第一次会引导你配置API Key。建议准备一个OpenAI或Anthropic的API Key来体验完整功能;如果本地有GPU,也可以用Ollama跑CodeLlama等模型(速度会慢些,但免费)。Aider会自动识别项目语言,Python、JavaScript、Go、Rust等主流语言都支持得不错。Aider的README写得特别详细,还附了一个真实项目的demo视频,看完基本就上手了。建议去仓库的Releases看最新变化,或者Issues里翻翻别人踩过的坑,比自己摸索快很多。

GitHub项目

Kohya’s GUI:训练LoRA模型的全能画布,轻松定制你的SD风格

如果你玩Stable Diffusion,迟早会想训练自己的LoRA——角色、画风或物体,而Kohya's GUI正是开源社区里最受欢迎的图形化训练工具箱。它把SD模型的LoRA、DreamBooth、Textual Inversion训练流程封装成直观界面,省去手写脚本的麻烦,适合想要微调模型的AI绘画爱好者。核心看点- 全流程图形化:从数据打标、配置参数到启动训练,全程在浏览器中操作,初学者也能快速上手。支持自动打标(Tagger)、正则化图像、学习率调度等功能。 - 多后端兼容:底层跑在PyTorch上,支持Windows/Linux,可调用NVIDIA GPU(CUDA)或AMD ROCm。原生集成xformers、DeepSpeed等优化,显存八仙过海。 - 活跃社区与模板生态:仓库持续更新,Issue/PR响应快。网上有大量预设配置文件,你只需改几项路径就能开始训练,大大降低门槛。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合想微调SD风格但不想写训练脚本的AI画师、设计师或爱好者。依赖Python 3.10+和NVIDIA显卡(建议8GB以上显存),可用CPU但会很慢。无需API Key,全部本地运行。许可证为Apache-2.0,可自由使用和修改。打开仓库的Releases页面下载打包版或直接pip install,跟着README里的Quick Start就能跑通第一个LoRA。更多技巧藏在Wiki和Discussions里,很适合逐个探索:Kohya's GUI官方仓库。

GitHub项目

想用自然语言写脚本?gptscript 让 AI 直接调度 API 与工具

写脚本时常常要查文档、拼参数,gptscript 想改变这件事:用一段自然语言描述你要做什么,它就能自动调用大模型来拆解任务、执行 API 调用和本地工具。对开发者来说,这意味着可以把日常自动化、数据查询、甚至 CI/CD 流程写成可读的“描述”,而不是堆代码。仓库采用 Apache-2.0 许可,README 清晰地列出了安装、运行和自定义工具链的步骤,最近还在持续加新功能和修复 issue。核心看点- 自然语言驱动:只要用英文描述目标(比如“下载最近 10 条 GitHub Release 信息并汇总成邮件”),gptscript 就会自动规划步骤、调用内置或自定义的工具完成,不需要手写 curl 或 Python 胶水。 - 可扩展的工具生态:支持接入任意 HTTP API、脚本、甚至第三方 Agent,开发者可以把自己的本地命令或微服务注册为 gptscript 的“工具”,复用性很强。 - 运行透明可调试:命令行模式下会打印每一步的推理过程和工具调用详情,方便你理解它到底做了什么,也方便修正 prompt 或工具描述。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁后端/DevOps 开发者、AI 应用原型师,以及任何希望通过自然语言快速编写自动化脚本的人。依赖很简单:只需要一个 Python 3.10+ 环境,以及一个 OpenAI API Key(或兼容接口),无需 GPU。第一次试用可参考仓库里给的“5 分钟快速开始”示例。用 gptscript 写脚本就像跟同事交代任务——试试看修改描述里的措辞,还能得到完全不同的执行路径。详细用法和工具注册方法都在 gptscript 官方仓库的 README 里,值得花几分钟翻一翻。

GitHub项目

SwarmGPT:让多智能体协作自动化处理复杂AI任务

面对需要多步骤推理、跨平台调用或复杂数据处理的AI任务,单一大模型往往力不从心。SwarmGPT 提供了一个轻量级的框架,让你能轻松编排多个 Agent 进行协作,无需构建庞大的工程体系。核心看点极简的 Agent 编排逻辑:基于 OpenAI 官方 Swarm 理念优化,通过简单的函数调用和状态管理,实现 Agent 间的无缝交接与任务分解,代码可读性极高。原生多模型支持:不仅兼容 OpenAI,还良好支持本地部署模型,方便在成本敏感场景下落地。即插即用的工具链:内置丰富的常用工具接口,开发者可快速扩展自定义功能,解决特定领域的自动化难题。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)上手提示项目采用 MIT 许可证,商业化无忧。主要依赖 Python 环境,建议配合支持 Function Calling 的 LLM 使用。对于需要私有化部署的团队,结合本地模型即可快速搭建专属的多智能体工作流。想深入了解如何构建你的第一个多 Agent 应用,直接查看 README 获取详细教程。

GitHub项目

VLLM:高性能 LLM 推理引擎,轻松部署大模型服务

如果你正在为部署大语言模型的推理延迟和吞吐量发愁,vLLM 可能是你需要的开源利器。它利用 PagedAttention 技术高效管理显存,显著提升推理速度,特别适合那些需要自建模型服务的开发者和团队。核心看点- PagedAttention 显存管理:借鉴操作系统的分页机制,将 KV Cache 按块管理,减少显存碎片,支持更高并发与更长上下文。 - 高吞吐与低延迟:支持连续批处理、异步调度,实测吞吐量可达传统框架的 2~4 倍,非常适合生产环境。 - 兼容 OpenAI API:提供与 OpenAI 兼容的 RESTful API,可无缝替换或集成现有应用,支持 Hugging Face 模型权重直接加载。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁适合需要部署开源大模型(如 Llama、Mistral、Qwen 等)的开发者,要求 Python 3.8+ 和 CUDA 11.8+ 环境。无需额外 API Key,模型权重需自行下载或从 Hugging Face 加载。推荐使用 A100、V100 等显存充足的 GPU 获得最佳体验。赶快去仓库看看 README 中的快速开始和性能调优建议,社区活跃的 Issue 和 PR 也能让你少踩坑。仓库地址:vLLM GitHub 仓库

GitHub项目

Instructor:让大模型输出直接变成 Python 对象

还在对着 choices[0].message.content 手写 JSON 解析,一边担心字段缺失一边写重试?Instructor 就是针对这个场景的库,适合天天和大模型 API 打交道的 Python 开发者。它把「结构化输出」变成声明式配置,模型返回什么、怎么校验,用 Pydantic 一页纸说清楚。核心看点- response_model 一步到位:把 response_model=User 追加到 chat completion 参数里,拿回来的直接是 Pydantic 实例,而不是乱糟糟的字符串。 - 多后端都接得住:OpenAI、Anthropic、Gemini、Mistral,连 llama-cpp-python 本地模型也可以,切换成本比想象中低。 - 自动重试纠偏:模型输出不符合 schema 时,Instructor 会把校验错误传回模型并自动重试,省掉大量后处理代码。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁给 Agent 做函数参数抽取、做信息抽取落库的 AI 应用开发者,或者想少写 prompt 解析逻辑的研究者。需要 Python 3.9+,用云端模型要自己配 API Key;玩本地模型则再加一个 llama-cpp 依赖。许可证是 MIT,源码可直接读。真想提升 Agent 稳定性,与其堆提示词,不如把输出钉在类型上。更多流式与多轮补全的玩法,去 README 里的 examples 挖一挖:instructor 仓库主页。

GitHub项目
最新

DeepSpeed 不止省显存:训练推理一把抓的开源提速库

如果你和我一样,在本地调大模型时总被 OOM 劝退,DeepSpeed 值得花十分钟看一下。这是微软开源的深度学习优化库,专治大模型训练和推理时的显存焦虑,Apache-2.0 协议,社区相当活跃,不是躺在仓库里吃灰的项目。核心看点- ZeRO 系列优化:把模型参数、梯度、优化器状态切分到多卡或多设备上,配合 Offload 还能把部分数据放到 CPU/SSD,让原来塞不进的模型跑起来。对单卡玩家和集群用户都有实际帮助。- 推理能力同样能打:支持 DeepSpeed-Inference,包含内核融合、稀疏算子、KV Cache 等优化,同一套工具链从训练过渡到部署,不用来回切换框架。▲ github.com(阿里云通义万相 生成配图,非网页截图)- 上手不算陡:继承自 PyTorch 的写法,对已有代码改造量小。常用功能都有文档和示例,遇到问题在 GitHub Issues 里找答案很方便。适合谁主要面向用 PyTorch 做大模型训练、微调或推理的工程师与研究者。如果手里只有一两张消费级显卡,又想跑超出显存容量的模型,ZeRO-Offload 值得试试。需要熟悉 Python 和 PyTorch 基础,按 README 安装依赖即可,不需要额外 API Key。想了解具体的 ZeRO 阶段、Offload 策略和推理加速配置,直接去仓库的 README 和官方文档翻一翻。动手之前记得先确认你的 PyTorch 和 CUDA 环境匹配,再对照示例跑通一个模型,感受会直观很多:进入 DeepSpeed 仓库

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.