跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

ms-swift:一条命令微调全模态大模型,LoRA 和 DeepSpeed 都搞定

微调一个开源模型,光是环境适配、数据格式化、多卡并行就够劝退一半人。ms-swift 把这一整套流程收敛为命令行工具,适合想快速验证直觉的算法工程师和研究者。核心看点- 全模态覆盖:除了常规 LLM,也支持视觉、语音等多模态模型的微调、推理与导出,省掉四处找轮子的时间。 - 训练配置开箱即用:内置 LoRA、QLoRA、全参微调以及 DeepSpeed 策略,能直接套用现成脚本,日志清晰,调试相对省心。 - 生态丰富:兼容多种模型格式与数据集来源,自动下载模型权重,社区活跃,踩坑记录容易搜到。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁有基础 GPU 环境、想做模型微调或风格定制,但不想从零搭建训练链路的人。普通开发者可以用小模型先跑通 demo;研究者也能方便复现对比实验。不需要 API Key。项目采用 Apache-2.0 许可证,模型权重使用时以各模型本身许可为准。如果你正在比较不同微调框架,建议直接打开ms-swift 的 README 查看支持矩阵与快速上手命令,文档里还附了常见任务示例。

GitHub项目

用自然语言操作本地文件?这个开源Agent框架做到了

如果你曾幻想过对电脑说“帮我整理桌面文件,把PDF按项目分类归档”,却苦于没有趁手的开源工具,那这个仓库值得你立刻点开。它让LLM直接接管文件系统、调用Shell命令,甚至操作浏览器,而这一切都在本地运行,无需上传隐私数据。核心看点- 自然语言驱动文件操作:支持“找到上周修改的图片并压缩”这类模糊指令,Agent自动解析意图并拆解为find、zip等底层命令,无需手写脚本。 - 模块化工具注册:内置文件读写、代码执行、网页抓取等工具,开发者可像搭积木一样扩展自定义工具(如数据库查询、API调用),依赖注入机制让集成成本极低。 - 多模型后端兼容:默认支持OpenAI兼容接口,也提供llama.cpp本地推理适配器,可在无GPU的笔记本上运行小模型(如Qwen2.5-7B),兼顾隐私与性能。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁- 开发者:快速为现有项目添加“语音/文本→自动化操作”能力,例如让运维机器人根据日志摘要重启服务。 - 普通用户:厌倦了重复性文件整理或批量重命名?装个本地模型就能当“数字管家”。 - Agent研究者:仓库提供了清晰的工具抽象层和任务编排示例,适合作为自定义Agent原型的起点。 - 依赖:Python 3.10+,无GPU也可运行(CPU推理速度较慢),默认无需API Key(若用本地模型)。最后,翻翻它的README,你会发现从“一句话压缩视频”到“自动生成周报”的完整案例。仓库的Issues里还有不少社区贡献的实用工具,比如微信文件自动归档。快戳 open-interpreter 看看能否成为你的效率外挂。

GitHub项目

Open-Sora 开源视频生成:本地复现 Sora 级效果

Sora 刷屏之后,很多团队都在拆解怎么复现,Open-Sora 是最早把完整流程摊开来的开源实现之一。它适合想上手视频生成训练/推理的开发者,也值得关注扩散模型架构的爱好者围观。核心看点- 完整训练管线:从视频处理、图像编码到扩散 Transformer 训练都有配套脚本,能看清生成背后的每一环,而不是只调黑盒 API。 - 推理与演示开箱即用:仓库提供 Gradio 示例与预训练权重入口,先跑通生成再谈二次开发,节奏很友好。 - 版本迭代快、社区活跃:代码侧采用 Apache-2.0 许可,结构清晰,适合在此基础上改模型或加数据集。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁比较适合想本地调试视频生成模型的研究者,也适合动手能力强的 AI 爱好者。依赖主要是 PyTorch 环境,具体显存和版本要求以 README 为准;注意权重与代码许可不同,商用前要核对。如果想看到实际生成的视频片段,或者想了解训练配置,直接打开 README 里的快速开始和示例页就行;调参经验可以在 Discussions 里翻一翻。Open-Sora 仓库直达

GitHub项目

opencode:把 AI 编程代理装进终端,会话还能分享给同事

如果你大部分时间待在终端里,大概不想为了用 AI 改代码再切到浏览器。opencode 想做的是把这件事按回键盘前:在项目目录里起一个 TUI,让它读文件、改代码、跑命令,改了什么一眼能看清。常用 CLI 的开发者、想给团队统一一套 AI 编码流程的人,会比较有感。核心看点- 终端原生界面:不依赖 IDE 插件,改动以 diff 形式呈现,接受还是回退都在同一个窗口完成,上下文不用来回复制粘贴。 - 模型可自由替换:通过 provider 配置接入 Anthropic、OpenAI、Google 以及本地推理端点,不想被某一家绑住的话这点很实在。 - 会话可分享:每条会话能生成链接,复盘思路时把链接丢给同事,比截图和口头描述省事;客户端与服务端分离,也方便跑在远端机器上。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 Node.js 环境,装好后配置好模型和 API Key 即可启动;如果走本地模型,把端点指向自己的推理服务也行。仓库采用 MIT 许可,代码本身宽松,但调用的第三方模型服务条款要单独看,以仓库 LICENSE 与各家说明为准。建议第一次在测试分支或临时目录里跑,确认行为符合预期再用于正式项目。想判断合不合手,最快是翻 README 里的安装命令和配置片段,再去 Releases 看最近的改动、Discussions 里看别人踩过的坑。到 GitHub 看 opencode

GitHub项目

DSPy 让大模型提示词工程变可编程,告别手写 Prompt 碎片

还在为几十条 Prompt 维护头疼?试试斯坦福开源的 DSPy——它把「提示词工程」抽象成类似 PyTorch 的声明式模块,用优化器自动调整 Prompt 与权重,而不是靠人肉调词。适合做 RAG、Agent 或多步推理管线的研究者与工程师,能明显减少调试咒语的痛苦。核心看点- 模块化声明式 API:用 dspy.ChainOfThought、dspy.ReAct 等封装推理步骤,用代码组织复杂流程,Prompt 不再散落各处。 - 自动优化器:内置 BootstrapFewShot、MIPRO 等编译器,能从少量示例中自动生成高质量 few-shot 与指令,效果常优于手动设计。 - 多后端兼容:支持 OpenAI、Anthropic、Cohere 以及本地模型(通过 Ollama 等),同一套代码可切换不同 LM,方便对比。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁如果你正在做 RAG 问答、Agent 工具调用或多跳检索,且对结果一致性有要求,DSPy 很值得一试。依赖主要是 Python 与一个可用的 LLM 接口;若用本地模型,需要提前跑起 OpenAI 兼容服务。项目以 MIT 许可发布,社区活跃,文档里有大量示例 Notebook。想快速感受「写 Python 替代拼 Prompt」的体验,直接去看看 DSPy 的 README 与示例,很多模式直接抄就能用。

GitHub项目

Docling:把 PDF 转成 Markdown,RAG 前先跑一遍

做 RAG 的人大概都踩过同一个坑:模型换了一轮又一轮,结果卡住的原因却是 PDF 里那张跨页表格被抽成了乱码。Docling 就是冲着这件脏活来的文档解析库,适合正在搭知识库的开发者,也适合只想把论文、财报、扫描件转成 Markdown 的普通用户。核心看点- 版面结构尽量还原:双栏排版、标题层级、表格、公式、图片位置都试着保留下来,导出 Markdown、JSON 或 HTML,而不是吐一大坨没有顺序的纯文本。 - 本地跑得动:默认走本地模型推理,合同、病历这类不方便上传云端的文档可以离线处理。 - 接得上现有链路:解析结果能直接喂给常见的 RAG 框架和向量库,省掉自己写清洗脚本的时间。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示装好 Python 环境后 pip 安装即可,首次运行会自动下载版面分析和 OCR 相关的模型权重,CPU 能跑,有 GPU 会顺很多。命令行和 Python API 两种用法都有,批量处理一整个目录的 PDF 也不用写太多代码。许可证与模型权重条款以仓库内的 LICENSE 为准,商用前自己确认一遍。想先看效果,可以直接翻 README 里的示例输出,再对着 Releases 挑个版本装上试。仓库在这:docling:把 PDF 变成能喂给 RAG 的干净文本

GitHub项目

TEN-Agent:把实时语音+视觉 Agent 装进自己的服务

搭一个能听、能看、能对话的 AI Agent,最烦人的往往不是模型本身,而是把音频流、STT、LLM、TTS 和摄像头输入手动串起来。TEN-Agent 把这套链路做成了可编排的实时多模态 Agent 运行时,适合想快速落地语音助手、智能终端或远程协作场景的开发者。核心看点- 实时多模态对话:支持语音、视频和文本输入同时进 Agent,自带打断与状态控制,不是简单的一问一答。 - 可视化 Agent Graph:用节点方式编排 STT、LLM、TTS 和业务逻辑,改一个分支不用推倒重写,调试时能直接看服务端消息流。 - 模块化后端与干净许可:ASR、LLM、TTS 都可替换接入,仓库以 Apache-2.0 开源,团队拿来改造商用心里比较有底。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示直接先看仓库里的 Playground 示例,按 README 配环境变量即可跑通一个基本对话 Agent。想体验完整语音链路,需要准备 ASR/TTS 或 RTC 厂商的 Key;如果只验证推理逻辑,先开文本模式更省事。文档和 issue 讨论都比较活跃,跟着官方示例比从零看协议更舒服。建议别只看 Readme 第一屏,花几分钟翻一遍 agents 目录和 Graph 示例,很多细节比教程讲得清楚:TEN-Agent 仓库

GitHub项目

CogVideo 开源视频生成模型,零门槛生成高清短片

如果你在找一款开源的文本到视频生成模型,CogVideo 值得你点开仓库。它来自清华团队,基于预训练的语言模型进行视频生成,不需要昂贵的商业 API,本地部署就能跑。对于想研究视频生成或者快速产出短视频原型的开发者来说,这是目前少有的高质量开源选择。核心看点- 多版本可选:官方提供了 9B 和 5B 参数的模型权重,兼顾效果与资源消耗。支持文本生成视频、图像生成视频两种模式。 - 高效推理架构:采用 VQ-VAE + Transformer 结构,结合 3D causal attention,能在 10 秒左右生成 4 秒 720×480 分辨率的视频(取决于显存)。 - 中文友好:模型对中文提示词理解较好,直接输入中文描述即可生成符合语义的视频,无需额外翻译。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示部署需要至少 24GB 显存的 GPU(推荐 RTX 4090 或 A100),项目基于 PyTorch,通过 Hugging Face 下载权重。官方提供了详细的 Docker 镜像和 gradio demo,拉下来就能跑。无需 API Key,所有推理在本地完成。MIT 许可证,商用或二次开发都很自由。不过注意,当前版本生成的人脸细节和复杂动作仍有失真,适合做概念演示或辅助素材生成。建议先去 README 看看模型局限性和未来计划,说不定你的使用场景正好契合。仓库地址: CogVideo GitHub 仓库

GitHub项目

Whisper:OpenAI 开源语音识别,本地部署准确率超乎想象

如果你正在找一个能离线、精准识别多种语言的语音转文字方案,OpenAI 开源的 Whisper 几乎是最省心的选择。它不需要联网,不依赖第三方 API,直接用模型在本地跑,尤其适合开发者集成到自己的应用或研究语音场景。核心看点开箱即用的多语言支持:Whisper 训练数据覆盖近百种语言,对中文、英文等主流语种识别效果接近人类水平,还能自动检测语言并翻译成英文。 模型体积灵活可选:从 tiny(约 1GB 显存)到 large(约 10GB 显存)共 5 个尺寸,笔记本 CPU 也能跑最小模型,GPU 则获得实时速度。 MIT 许可证,社区生态完善:官方提供 Python 包和 CLI 工具,社区衍生出了 whisperX、faster-whisper 等加速方案,生产环境落地很方便。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁做语音笔记、会议转录、视频字幕生成的个人开发者;需要离线语音理解能力的嵌入式或边缘设备研究者;以及想微调语音模型但缺高质量基座的研究团队。Whisper 直接 pip install 就能用,不强制 GPU,对 Python 3.8+ 友好。更详细的安装步骤、模型下载说明和多语言用法,建议直接去仓库的 README 里扫一遍,里面有完整的参数表和示例代码——点此直达 OpenAI Whisper 主页。

GitHub项目

crawl4ai:把网页洗成 LLM 爱吃的 Markdown,RAG 不用手搓数据

做 RAG 最烦的往往不是模型,而是喂进去的网页又脏又碎:导航、广告、JS 渲染的内容混在一起,切完 chunk 全是噪声。crawl4ai 就是冲这件事来的——一个专门给 LLM 备料的开源爬虫,输出直接是干净 Markdown 和结构化 JSON。开发者、自建知识库的人、跑 Agent 的人都能少写一堆清洗代码。核心看点- 为 LLM 优化的输出:默认把页面转成 Markdown,保留标题层级、表格、代码块,也支持用 CSS/XPath 提取结构化字段,预处理量能省一大截。 - 不用从零手写爬虫:异步并发抓取,可接 Playwright 渲染 JS 页面,带会话、代理、去重和整站爬取模式。 - 能当数据摄取层:对上可以接主流 LLM 做内容过滤与抽取,对下能塞进 Agent 或 RAG 流程里补实时网页上下文。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁典型场景是自建知识库、资讯或竞品监控、给 Agent 补实时网页信息。依赖 Python 环境,需要浏览器渲染时用 crawl4ai-setup 装 Playwright;部分抽取能力要自备 API Key,也可以换本地模型。项目采用 Apache-2.0 许可,商用前建议以仓库 LICENSE 为准。想先试水,就跑 README 里那段最小示例抓一个页面,再去翻它的 Markdown 生成器和提取策略说明。去 crawl4ai 仓库翻一眼

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.