Translating this page to English in your browser…
跳到内容

夜深了,注意休息,愿你今夜好梦。

Docling:把 PDF 转成 Markdown,RAG 前先跑一遍

做 RAG 的人大概都踩过同一个坑:模型换了一轮又一轮,…

TEN-Agent:把实时语音+视觉 Agent 装进自己的服务

搭一个能听、能看、能对话的 AI Agent,最烦人的往…

Transformers:统一 API,换模型不用重写管线

一个人调模型最怕的不是没显卡,而是今天换这个明天换那个,…

MiniCPM-V:端侧多模态新选择,手机也能跑高精度识别

做多模态应用时总被模型体积和显存卡住?想找个能离线跑、中…

OmniParser:多模态Agent的UI屏幕解析利器

做 Agent 卡在最尴尬的一步:模型看得见截图,却看不…

Parler-TTS:开源语音合成,几行代码生成自然语音

做语音总被困在在线 API 的限速和账单里?Parler…

OlmoOCR:高保真PDF转文本,RAG解析不头疼

很多搭 RAG 管线的人,最后都会卡在 PDF 解析上:…

ms-swift:一条命令微调全模态大模型,LoRA 和 DeepSpeed 都搞定

微调一个开源模型,光是环境适配、数据格式化、多卡并行就够…

Open-Sora 开源视频生成:本地复现 Sora 级效果

Sora 刷屏之后,很多团队都在拆解怎么复现,Open-…

PaddleOCR:一行命令搞定中文场景识别,PDF表格文字直接抽

做文档处理的人都知道,把 PDF、截图里的文字和表格变成…

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.