跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

Outlines:让 LLM 输出严格遵循 JSON 模式的可靠生成框架

你是否受够了 LLM 胡编乱造 JSON 格式?Outlines 是一个轻量但强大的 Python 库,让大模型输出严格遵循你定义的 Pydantic 模型或 JSON Schema,无需反复提示词调优。它通过约束解码(constrained decoding)在生成阶段直接控制 token 采样空间,特别适合需要结构化输出的 Agent、RAG 链路和 API 后端开发者。核心看点- 声明式结构化输出:直接传入 Pydantic 类或 JSON Schema,模型生成的结果自动匹配格式,支持嵌套、可选字段和枚举约束。 - 多后端兼容:原生支持 llama.cpp、vLLM、Transformers 以及 OpenAI API 兼容接口,一套 API 切换本地和云端模型。 - 轻量无侵入:不修改模型权重,仅通过正则或 FSM(有限状态机)在采样时引导生成,推理速度几乎无损失。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁正在构建 函数调用、数据抽取、表单生成、SQL 查询生成 等需要可靠结构化输出的开发者。依赖 Python 3.8+,无需 GPU 即可使用 OpenAI 后端;若本地部署,推荐配合 llama.cpp 或 vLLM 使用。项目采用 Apache-2.0 许可证。想彻底告别 JSON 解析异常?去 Outlines 的 README 看看它如何用几十行代码搞定复杂约束,社区还提供了丰富的 Pydantic 示例。

GitHub项目

ChatGPT-Next-Web:自部署的跨平台AI聊天面板,一键接入多模型

厌倦了官方ChatGPT的订阅限制或频繁的网络问题?这个开源项目让你用Vercel或Docker在几分钟内部署一个功能完整的AI聊天Web UI,支持OpenAI、Claude、Gemini、本地模型(Ollama)等多种后端,并内置会话管理、Markdown渲染、语音输入等实用功能。适合想要拥有私人AI助手、团队共享API额度或折腾自托管方案的开发者与重度用户。核心看点- 多模型一键切换:在同一个对话界面里自由切换GPT-4、Claude 3、Gemini Pro甚至本地跑起来的Llama 3,不用再开多个标签页。 - 零门槛部署:支持Vercel一键部署(免费额度足够个人使用)、Docker本地运行、以及手动构建,README提供清晰的步骤截图,即使前端新手也能在10分钟内上线。 - 实用细节拉满:内置会话文件夹管理、Prompt模板库、导出/导入对话记录(JSON/Markdown)、全局遮罩(Mask)功能可预设角色设定,还支持PWA离线访问。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 无需GPU:纯前端项目,后端API由你指定的模型服务商提供(需自行申请OpenAI等API Key,或搭配Ollama使用本地模型)。 - Node.js 18+ 即可本地开发,Docker部署则需Docker Engine 20+。项目采用MIT许可证,可自由修改和商用。如果想给团队搭建一个统一的AI对话入口,或者单纯想摆脱官方客户端的种种限制,直接去仓库看README里的Vercel部署按钮,点一下就能拥有自己的AI面板。传送门:ChatGPT-Next-Web

GitHub项目

crawl4ai:把网页洗成 LLM 爱吃的 Markdown,RAG 不用手搓数据

做 RAG 最烦的往往不是模型,而是喂进去的网页又脏又碎:导航、广告、JS 渲染的内容混在一起,切完 chunk 全是噪声。crawl4ai 就是冲这件事来的——一个专门给 LLM 备料的开源爬虫,输出直接是干净 Markdown 和结构化 JSON。开发者、自建知识库的人、跑 Agent 的人都能少写一堆清洗代码。核心看点- 为 LLM 优化的输出:默认把页面转成 Markdown,保留标题层级、表格、代码块,也支持用 CSS/XPath 提取结构化字段,预处理量能省一大截。 - 不用从零手写爬虫:异步并发抓取,可接 Playwright 渲染 JS 页面,带会话、代理、去重和整站爬取模式。 - 能当数据摄取层:对上可以接主流 LLM 做内容过滤与抽取,对下能塞进 Agent 或 RAG 流程里补实时网页上下文。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁典型场景是自建知识库、资讯或竞品监控、给 Agent 补实时网页信息。依赖 Python 环境,需要浏览器渲染时用 crawl4ai-setup 装 Playwright;部分抽取能力要自备 API Key,也可以换本地模型。项目采用 Apache-2.0 许可,商用前建议以仓库 LICENSE 为准。想先试水,就跑 README 里那段最小示例抓一个页面,再去翻它的 Markdown 生成器和提取策略说明。去 crawl4ai 仓库翻一眼

GitHub项目

Ollama:一行命令本地跑大模型,开发者私藏推理神器

厌倦了配置复杂的推理环境?Ollama 让你像用 Docker 一样,一条命令就能在本地拉起 Llama 3、Qwen2、Mistral 等主流开源模型。无论是 Mac、Linux 还是 Windows,安装后即可通过 REST API 或终端交互,特别适合需要离线调试、隐私优先或快速原型验证的开发者。核心看点- 极简部署体验:ollama run llama3.2 即可下载并运行模型,自动处理量化、依赖和端口映射,无需手动配置 Python 或 CUDA。 - 丰富的模型库:内置数百个预配置模型,覆盖 7B 到 70B 参数规模,支持 GGUF 格式自定义导入,且社区持续贡献新模型。 - API 与生态兼容:提供 OpenAI 兼容的 /v1/chat/completions 接口,可直接对接 LangChain、Continue、Open WebUI 等工具,本地开发无缝切换。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁- 个人开发者:快速测试不同模型效果,或构建本地 AI 助手。 - 隐私敏感场景:医疗、金融等数据不出本地的推理需求。 - 边缘设备玩家:通过量化模型在 8GB 内存的 MacBook 上流畅运行 7B 参数模型。无需 GPU,CPU 也能跑,但推荐至少 16GB 内存。Ollama 的 README 清晰列出了所有命令和模型标签,如果你想了解如何自定义 Modelfile 或接入外部工具,直接去仓库看 Ollama 官方仓库 的文档和 Discussions,社区里有很多实用技巧。

GitHub项目

本地运行多模态大模型,llama.cpp 生态再添新成员

如果你还在为在消费级硬件上运行多模态大模型而发愁,这个仓库或许能让你眼前一亮。它基于 llama.cpp 的 GGUF 格式,让你可以在 CPU 或低显存 GPU 上跑起视觉语言模型,无需昂贵的 A100。对于想要本地体验 LLaVA、BakLLaVA 等模型的开发者和爱好者来说,这是个开箱即用的选择。核心看点- 低门槛推理:利用 llama.cpp 的量化能力,将 7B 参数的多模态模型压缩到 4-6 GB,普通笔记本也能运行。 - 原生支持多模态:不仅处理文本,还能直接接受图像输入并生成描述或回答,实现图文对话。 - 活跃社区维护:基于 MIT 许可证,近期仍有提交,Issue 和 PR 响应及时,适合二次开发或集成到自己的项目。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)上手提示推荐在 Linux 或 macOS 上使用,Windows 需配合 WSL。无需 GPU,但 16GB 以上内存能获得更好体验。无需任何 API Key,下载 GGUF 模型文件即可运行。如果你是本地 AI 应用开发者,或想离线使用多模态功能,这个仓库值得一试。感兴趣的话,直接去 README 查看快速开始和示例,还能找到社区预制的模型权重。仓库地址:llama.cpp 多模态扩展

GitHub项目

Khoj:本地AI搜索你的知识库,比Obsidian自带搜索好用十倍

还在为记不清笔记放在哪个文件夹而抓狂?Khoj 能直接索引你本地的 Markdown、PDF、图片甚至代码,并用本地或云端的大模型给你精准答案。对 Obsidian、Logseq 用户来说,这几乎是知识管理的终局形态——安装一个插件,你的所有笔记瞬间拥有一个会思考的搜索引擎。核心看点- 多种数据源统一索引:支持本地文件、Obsidian 保险库、LaTeX、Org-mode 等,甚至能读取图片中的文字。索引后可通过自然语言提问,Khoj 会召回最相关片段并生成回答。 - 自由选择推理后端:既可以用 ChatGPT、Claude 等云端 API,也能全部在本地跑(通过 llama.cpp、Ollama),完全离线也能用。MIT 许可证,代码透明,隐私可控。 - 跨平台触手可及:桌面端有 Obsidian 插件、Emacs 包、Web 界面,移动端也有对应客户端。查询时还能一键跳到原始文件位置,非常顺手。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁- 笔记重度用户:如果你每天记大量笔记但检索低效,Khoj 能直接给出理解后的答案,而不是单纯的关键词匹配。 - 隐私敏感的研究者:选择本地模型,所有数据不出机器,适合处理敏感文档。 - 喜欢折腾的自部署玩家:通过 Docker 或 pip install khoj 就能跑起来,依赖 Python 3.10+ 和至少 8GB 内存。若用本地模型还需 GPU,但也可纯 CPU 推理(速度稍慢)。Khoj 的 README 写得相当详尽,从安装到自定义插件都有教程。如果你也想让自己的笔记“活”起来,不妨点开仓库看看:GitHub - khoj-ai/khoj

GitHub项目

Mochi 1 开源视频生成:一句提示词生成流畅电影级动态

如果你试过 Sora 但没资格内测,或者被闭源模型的价格劝退,Genmo 开源的 Mochi 1 可能是目前最值得你本地跑一把的视频生成模型。它用 Apache-2.0 许可发布,不需要排队,直接下载权重就能在单卡 A100 上生成 5 秒左右的连贯视频,效果直逼商业方案。核心看点端到端视频扩散:基于 Asymmetric VAE 和 Transformer 架构,直接在 RGB 像素空间生成视频,省去了单独动捕或帧插值步骤。支持 8 秒 540p 的原始分辨率,运动幅度和物体一致性比前代 CogVideoX 更自然。开源权重 + 商业友好许可证:模型权重和推理代码一并放出,MIT 许可证改写和商用限制极少,无论是做独立创作者工具原型还是集成到自家产品,法律风险都很低。▲ github.com(阿里云通义万相 生成配图,非网页截图)社区灵活扩展:官方提供了 Gradio 网页界面和 CLI 两种启动方式。已有开发者尝试 LoRA 微调来控制特定风格,Issues 里也有人在讨论低显存优化(如 FP8 量化)。上手提示建议使用 Linux + Python 3.10,单张 A100(40GB) 即可跑 5 秒视频;如果只有 24GB 显存(如 3090),可以降低帧数量或用官方的蒸馏版模型。权重自动从 HuggingFace 下载,约 10GB。仓库的 README 里贴了现成的 pip install -r requirements.txt 和启动命令,十分钟就能看到第一个 demo。想立刻体验文字到视频的创作快感,直接戳 genmo/mochi 跑起官方脚本,Issues 区还有不少社区调参经验等你挖。

GitHub项目

MLC LLM:大模型边缘推理新选择,手机浏览器秒跑开源LLM

还在为本地跑大模型必须配高端GPU发愁?MLC LLM 是专为边缘设备设计的推理引擎,目标就是让模型在手机、笔记本甚至浏览器里也能流畅运行。如果你经常需要把LLM部署到非云端环境,或者想研究量化与编译优化的实战方案,这个仓库值得你从头翻一遍 README。核心看点- 跨平台后端全覆盖:支持 Metal(macOS/iOS)、Vulkan(Android/Linux)、CUDA(NVIDIA)以及 WebGPU(浏览器),一套代码适配多种硬件。 - 编译+量化双优化:通过 TVM 编译器对模型进行自动代码生成和 int4/int8 量化,推理速度与显存占用都大幅优化,实测在旗舰手机上可达每秒数十 token。 - 即装即用与自定义双模式:提供预编译的 Python/CLI 包,直接运行主流模型(Llama、Mistral、Gemma 等);也开放编译管道,允许你优化自己的模型权重。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 场景:需要低延迟本地推理的 APP 开发者、研究边缘部署的算法工程师,或想在没有 GPU 的笔记本上体验 LLM 的爱好者。 - 依赖:Python 3.10+,安装 mlc-llm 和对应后端依赖(如 Vulkan SDK);若只需 Web 版,直接导入 WebLLM npm 包即可。 - 许可:采用 Apache-2.0 许可证,商业友好,但模型权重需单独下载并遵守各自许可。打开仓库的 MLC LLM README,里面附带了手机端 Demo 二维码、性能基准和详细的编译指南,刷一遍就能判断它能否解决你的边缘部署痛点。

GitHub项目

Transformers:统一 API,换模型不用重写管线

一个人调模型最怕的不是没显卡,而是今天换这个明天换那个,调用代码跟着返工。Hugging Face Transformers 把主流 NLP、视觉、音频模型收进同一个入口,做模型对比和快速原型的时候特别省事。核心看点接口统一:从 AutoModel 到 pipeline,切模型常常只改模型名和配置,不用整段改写调用逻辑。训练推理一套代码:Trainer 适合跑微调,小模型 CPU 就能 debug,大模型再上 GPU。配套成熟:跟 Datasets、Hub、Accelerate 生态摆在一起,数据加载、权重托管、多卡训练都能接得上,少写很多胶水脚本。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示Python 环境装好直接 pip install transformers 就能跑,普通任务不需要 API Key。若只做推理,很多小模型用 CPU 也能应付;真要微调大模型再准备 GPU。主仓库采用 Apache-2.0 许可,但下载的模型权重时常另带条款,动手前先看对应 Hub 页的 LICENSE。README 的 pipeline 示例最接近零基础,熟悉了以后去 Examples 目录找脚本抄,比重新造轮子踏实。更多细节在 huggingface/transformers 仓库。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.