跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

LightRAG:把知识图谱塞进 RAG,检索又快又省 Token

做 RAG 的人大多踩过同一个坑:文档一多,检索要么召回不准,要么把大段原文硬塞进上下文,Token 烧得心疼。LightRAG 想解决的就是这件事——它把知识图谱的思路压进一套轻量实现里,让你用一台普通机器也能跑出「有关系、有层次」的检索效果。做企业知识库、文档问答、Agent 记忆层的开发者,值得点开看一眼。核心看点图结构与向量双路检索:既做实体关系抽取,也保留向量召回,问「谁和谁有关系」这类问题不再靠运气。增量更新:新文档进来可以只补增量,不必整库重建索引,日常维护成本低。接入门槛低:官方提供 Python SDK 与 API Server,能挂 Ollama 或 OpenAI 兼容接口,存储层可接 Neo4j、PostgreSQL 等,还配了 Web UI 方便先试手感。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示最省事的路径是先 pip 安装,指向一个本地或云端的模型服务跑一遍示例数据,再换成自己的文档。需要注意:实体抽取质量很大程度取决于你选了哪个 LLM,小模型跑出来的图会比较稀疏;仓库采用 MIT 许可证,商用相对宽松,但所依赖的模型权重与三方服务条款仍需以各自 LICENSE 为准。细节和最新改动建议直接看仓库 README 与 Releases,里面有完整配置项和示例脚本。去 LightRAG 仓库翻翻

GitHub项目

Open Notebook:自建 NotebookLM,资料变播客

NotebookLM 好用,代价是资料得放在别人服务器上。open-notebook 把类似体验搬回自己的机器:PDF、网页、音视频链接丢进去,边读边追问,还能生成两个人对谈的播客音频。做课题研究、课程整理、内容选题的人可以直接点开。核心看点多源收料:PDF、网页、Office 文档、视频链接都能进库,自动转写、切分、建索引,省掉手搓文本那一步。边问边溯源:可以限定在某个来源范围内对话,回答带引用,随时翻回原文核对,比纯聊天踏实。一键出播客:把选定资料转成两个 AI 主播的对谈音频,通勤路上听自己攒的料。▲ github.com(阿里云通义万相 生成配图,非网页截图)自托管:Docker 拉起服务,数据留在自己的机器或服务器;模型既接云端接口,也能指向本地推理服务。上手提示需要 Docker 环境,启动后在设置里填入模型 API Key(或改用本地兼容接口)。首次索引大文件会慢一些,建议先拿一两个文档把流程跑通再批量导入。项目采用 MIT 许可证,接入的模型与嵌入服务条款请以各自官方说明为准。想先看看界面长什么样、播客效果如何,去 open-notebook 仓库 翻一遍 README 和 Releases 就够了。

GitHub项目

Kokoro:82M 的 TTS 小模型,CPU 上也能跑出自然语音

想在本地做语音合成,第一反应往往是找显卡、下大权重、等推理。Kokoro 走的是另一条路:把 TTS 模型压到很小的体量,普通笔记本的 CPU 就能出声。适合做播客配音、有声书原型、读屏播报,以及想给 Agent「配一张嘴」的开发者。核心看点- 体积与速度:模型只有 80M 级别的参数量,推理几乎不挑硬件,验证想法时不需要先排队等 GPU。 - 多语言与许可:仓库与权重采用 Apache-2.0,中英日等多语种都有现成权重可用,落地前建议以仓库 LICENSE 和模型卡说明为准。 - 上手成本低:pip 装包即可调用,Hugging Face 上有官方权重,社区还贡献了 ONNX 等运行时,方便塞进已有服务。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示典型用法是写几行 Python,把文本丢给 pipeline 直接落成 wav;批量处理长文本时,自己按标点切句并做缓存,效果和速度都会更稳。需要 Python 环境,GPU 不是必须的;合成中文要挑对应的语言权重,别拿英文模型硬套。它不依赖云端 API Key,离线也能跑,对私有化部署比较友好。具体依赖与版本以 README 为准。想先听效果、再看支持的语言列表,可以直接翻 Kokoro 的 README 与 Releases,Issues 里也有不少关于语速、音色和部署的实战讨论。

GitHub项目

supervision:给视觉模型输出补上追踪、计数与可视化

跑通检测模型只是开始,真正磨人的是后处理:给每个框分一个稳定 ID、统计过线人数、把结果画成能交付的视频,这些胶水代码写起来一点也不比调模型轻松。supervision 把这些活收进一套轻量工具里,做视频分析、CV 落地的开发者能少写几百行可视化代码。核心看点检测结果后处理一站打包:目标追踪、区域计数、越线统计、轨迹绘制都有现成接口,接上 YOLO、SAM 这类模型即可使用。Annotator 组合式可视化:边框、掩码、标签、热力图都是独立组件,可自由叠加,也能直接写出视频文件,省掉手写 OpenCV 绘图的重复劳动。▲ github.com(阿里云通义万相 生成配图,非网页截图)数据集格式互转:COCO、YOLO、VOC 等标注格式之间的转换与校验不必自己写解析器,做数据清洗时很省事。上手提示pip 安装即可,依赖 NumPy、OpenCV 这类常规库,只做可视化与统计在 CPU 上也能跑;推理本身仍需自备模型权重(例如 Ultralytics 系列),GPU 只有跑模型时才用得上。项目采用 MIT 许可证,商用限制较少,具体条款以仓库 LICENSE 为准。README 里有一批短 GIF 演示和 recipes 示例,扫一眼就知道能不能接进你现有的流程:roboflow/supervision。

GitHub项目

opencode:把 AI 编程代理装进终端,会话还能分享给同事

如果你大部分时间待在终端里,大概不想为了用 AI 改代码再切到浏览器。opencode 想做的是把这件事按回键盘前:在项目目录里起一个 TUI,让它读文件、改代码、跑命令,改了什么一眼能看清。常用 CLI 的开发者、想给团队统一一套 AI 编码流程的人,会比较有感。核心看点- 终端原生界面:不依赖 IDE 插件,改动以 diff 形式呈现,接受还是回退都在同一个窗口完成,上下文不用来回复制粘贴。 - 模型可自由替换:通过 provider 配置接入 Anthropic、OpenAI、Google 以及本地推理端点,不想被某一家绑住的话这点很实在。 - 会话可分享:每条会话能生成链接,复盘思路时把链接丢给同事,比截图和口头描述省事;客户端与服务端分离,也方便跑在远端机器上。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 Node.js 环境,装好后配置好模型和 API Key 即可启动;如果走本地模型,把端点指向自己的推理服务也行。仓库采用 MIT 许可,代码本身宽松,但调用的第三方模型服务条款要单独看,以仓库 LICENSE 与各家说明为准。建议第一次在测试分支或临时目录里跑,确认行为符合预期再用于正式项目。想判断合不合手,最快是翻 README 里的安装命令和配置片段,再去 Releases 看最近的改动、Discussions 里看别人踩过的坑。到 GitHub 看 opencode

GitHub项目
最新

kotaemon:开箱即用的 RAG 文档问答,支持本地模型

手上攒了一堆 PDF、论文和内部资料,想直接对话式提问,又懒得从零写切分、检索、重排那一整条链路?kotaemon 就是冲着这个场景做的:它把 RAG 的脏活累活收进一个能直接跑起来的问答界面,开发者和重度文档用户都能少折腾几轮。核心看点- 问答开箱可用:把文档丢进去就能提问,回答会标出引用来源,能翻回原文对应片段核对。 - 检索不只靠向量:支持全文与向量混合检索,并可挂重排模型,比单纯 embedding 检索的命中更稳一些。 - 模型随便换:云端 API 和本地推理服务(Ollama、vLLM 这类)都能接,还带多用户与信息抽取类的进阶流程。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合想快速验证「文档 + 大模型」产品形态的开发者,以及要求数据不出内网的小团队。跑起来一般需要 Python 环境和 Docker,接云端模型要自备 API Key;纯本地跑的话,显存和机器配置得自己掂量。许可证为 Apache-2.0,商用前建议对照仓库 LICENSE 再确认一遍。想判断它到底能撑到什么程度,翻 README 的安装步骤和界面截图最直观,Discussions 里也有别人踩过的坑。去 kotaemon 仓库看看

GitHub项目
最新

nanochat:把大模型预训练到对话塞进一套代码,值得通读一遍

想弄明白 ChatGPT 这类模型到底是怎么被炼出来的,却总被分布式框架和层层配置劝退?nanochat 把分词、预训练、监督微调、强化学习到推理界面收进同一个仓库,适合愿意读代码、想建立全链路认知的开发者。核心看点- 全流程串成一条线:从原始语料处理到能对话的模型,各阶段用脚本衔接,不用在多个项目之间来回跳。 - 代码量克制:核心逻辑集中,抽象层不厚,读完更容易形成完整心智模型,而不是卡在封装里。 - 自带对话入口:训练完可以直接起一个网页界面聊两句,快速验证效果,闭环很短。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 NVIDIA GPU 与较新的 PyTorch / CUDA 环境,显存和训练时长取决于你选的模型规模,仓库按阶段拆分脚本,建议照 README 的顺序一步步跑。数据集与分词器需要额外下载,涉及权重和第三方数据的授权时,请以仓库 LICENSE 及数据源说明为准;项目采用 MIT 许可。想动手的话,先扫一遍 README 里的运行顺序,再去 Releases 和 Discussions 看别人踩过的坑,能省下不少排错时间。nanochat 仓库主页

GitHub项目

Krita AI Diffusion:不用切窗口,在画布里直接生成和重绘

画图的人大概都有过这种体验:出图在 ComfyUI,修图在 PS,图层和参数倒来倒去,一张图没画完先在软件之间走了一圈。Krita AI Diffusion 想解决的就是这件事——它把生成、重绘、扩图全塞进 Krita 的画布,笔刷和「AI 笔刷」在同一个界面里切换。插画师、漫画作者,以及想给自己的绘图流程接上模型的开发者,都值得点开看看。核心看点- 画布内直接出结果:选区生成、局部重绘、外绘扩展、放大细化都在同一个窗口完成,配合实时绘制的模式,笔还没提起来就能看到反馈。 - 复用 ComfyUI 做后端:采样器、ControlNet、LoRA 都交给 ComfyUI 节点跑,不必再学一套新配置;本地机器或局域网里的另一台显卡机器都能挂上去。 - 对线稿和分镜友好:线稿上色、草图细化、风格迁移这些漫画流程里最费时间的环节,可以按自己的习惯做成固定工作流反复调用。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合有本地显卡、平时就用 Krita 画画的人:需要 Krita 5.2 以上的版本,外加一个能正常工作的 ComfyUI 后端,纯 CPU 跑体验会很差。也可以连远程或云端的 ComfyUI,代价是延迟看网络。插件本体走 GPL 系许可证,但模型权重和各类 LoRA 的授权各不相同,下载前请以各自的 LICENSE 为准。安装步骤、快捷键和最近几个版本的改动,README 和 Releases 里都写得比较细,想动手的话先翻一遍再装:Krita AI Diffusion 仓库

GitHub项目
最新

Skyvern:让大模型看懂网页,表单自动化不用再写选择器

网页自动化最烦的地方不是写代码,而是页面一改版,昨天还能跑的脚本今天就报错,接着你又得去翻 DOM 找新的选择器。Skyvern 换了个思路:把「看懂页面」交给大模型和视觉能力,你只描述目标,它自己去定位元素、点按钮、填表单。做爬虫、RPA、内部流程自动化的开发者值得点开看看。核心看点尽量不写选择器:模型同时读取页面结构和截图来定位输入框、按钮,页面做小改动时,流程通常不至于整条报废。一条目标串起整个流程:登录、填表、翻页、下载文件、提取字段可以放进同一个任务,结果能整理成结构化数据。▲ github.com(阿里云通义万相 生成配图,非网页截图)可自托管,有可视化界面:能接多家 LLM 提供方,浏览器里能看到每一步的截图和执行记录,排查问题比翻日志直观。上手提示需要自己准备 LLM 的 API Key,本地部署走 Docker,会拉起 Postgres 等依赖,机器配置别太寒酸。仓库采用 AGPL-3.0,涉及商用或二次分发前请以仓库内 LICENSE 为准。建议先从 README 里最简单的表单任务跑通,再往复杂流程上试。想知道它目前支持哪些模型、最近加了什么能力,直接翻 Skyvern 的 README 与 Releases,那里的更新比二手介绍快得多。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.