跳到内容

下午好,继续加油,离目标更近一步。

ms-swift:一条命令微调全模态大模型,LoRA 和 DeepSpeed 都搞定

微调一个开源模型,光是环境适配、数据格式化、多卡并行就够…

Open-Sora 开源视频生成:本地复现 Sora 级效果

Sora 刷屏之后,很多团队都在拆解怎么复现,Open-…

PaddleOCR:一行命令搞定中文场景识别,PDF表格文字直接抽

做文档处理的人都知道,把 PDF、截图里的文字和表格变成…

Transformers.js:不用服务器,浏览器里直接跑大模型推理

如果你主要写前端,又想让页面里直接跑模型,这个库值得点开…

Meta SAM 2:开源图像分割模型,物体追踪与视频遮罩一气呵成

搞计算机视觉的朋友肯定对 Meta 的 SAM 不陌生,…

InternVL 视觉语言模型开源:多模态理解与图文对话还能本地跑

如果你正头疼怎么把大模型的能力扩展到图像理解上,又不想被…

对话式AI开发利器!NVIDIA NeMo帮你快速构建定制LLM应用

如果你正为如何高效搭建支持多轮对话、知识检索的 AI 应…

Mochi 1 开源视频生成:一句提示词生成流畅电影级动态

如果你试过 Sora 但没资格内测,或者被闭源模型的价格…

UI-TARS 开源多模态 GUI Agent,让大模型替你操作屏幕

还在为重复的 GUI 操作烦恼吗?由字节跳动开源的多模态…

Vocalize:用 GPU 加速本地语音合成,支持多语言与情感控制

如果你需要在本地快速生成自然、带情感的语音,又不想依赖云…

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.