跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

LocalAI:本地运行大模型与多模态的私有化推理引擎

LocalAI 是一个开源的自托管 AI 推理服务器,让你无需 GPU 或云端 API 就能在本地 CPU/GPU 上运行 LLM、图像生成、语音识别等多模态模型。它兼容 OpenAI API 格式,可直接替换现有应用的后端,特别适合注重数据隐私、离线场景或想低成本尝试 AI 能力的开发者与研究者。核心看点- 多模态支持:不仅支持 Llama、Mistral 等大语言模型,还集成了 Stable Diffusion 文生图、Whisper 语音转文字、TTS 语音合成,甚至支持 Reranker 和 Embedding 模型,一套服务覆盖多种推理需求。 - 无 GPU 也能跑:通过 llama.cpp 和 whisper.cpp 等后端,在纯 CPU 上即可运行量化模型(如 GGUF 格式),同时也可利用 CUDA、Vulkan 等加速,灵活适配不同硬件。 - OpenAI API 兼容:提供与 OpenAI 几乎一致的 REST API 接口,原有客户端代码几乎零修改即可指向本地 LocalAI 实例,方便从 SaaS 迁移到本地或进行混合部署。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)上手提示适合隐私敏感的企业内部知识库、离线环境下的个人助手、或想低成本尝试多种 AI 模型的学生与开发者。依赖 Docker 或 Go 环境,无需 GPU 也能运行,但若需加速建议配备至少 8GB 内存的 CPU 或低端 GPU。无需任何 API Key,所有推理都在本地完成;模型权重需自行下载,仓库 README 提供详细的一键启动脚本和示例。最后,如果你正寻找一个能统一管理 LLM、图像、语音推理的本地方案,不妨看看 LocalAI 的快速入门指南和预置模型列表,或许正是你需要的那个“瑞士军刀”。点此访问 LocalAI GitHub 仓库

GitHub项目

VLLM:高性能 LLM 推理引擎,轻松部署大模型服务

如果你正在为部署大语言模型的推理延迟和吞吐量发愁,vLLM 可能是你需要的开源利器。它利用 PagedAttention 技术高效管理显存,显著提升推理速度,特别适合那些需要自建模型服务的开发者和团队。核心看点- PagedAttention 显存管理:借鉴操作系统的分页机制,将 KV Cache 按块管理,减少显存碎片,支持更高并发与更长上下文。 - 高吞吐与低延迟:支持连续批处理、异步调度,实测吞吐量可达传统框架的 2~4 倍,非常适合生产环境。 - 兼容 OpenAI API:提供与 OpenAI 兼容的 RESTful API,可无缝替换或集成现有应用,支持 Hugging Face 模型权重直接加载。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁适合需要部署开源大模型(如 Llama、Mistral、Qwen 等)的开发者,要求 Python 3.8+ 和 CUDA 11.8+ 环境。无需额外 API Key,模型权重需自行下载或从 Hugging Face 加载。推荐使用 A100、V100 等显存充足的 GPU 获得最佳体验。赶快去仓库看看 README 中的快速开始和性能调优建议,社区活跃的 Issue 和 PR 也能让你少踩坑。仓库地址:vLLM GitHub 仓库

GitHub项目

用本地模型写代码?Continue 让 VS Code/JetBrains 秒变 AI 搭档

如果你既想享受 AI 编程助手的便利,又不想把代码片段上传到云端,Continue 是目前最成熟的本地方案。这个开源项目让你在 VS Code 或 JetBrains IDE 里直接接入本地推理后端(如 llama.cpp、Ollama),也能连 OpenAI、Anthropic 等云端 API——全凭你选择。项目持续活跃,MIT 许可证,社区已经积累了相当多的插件与配置示例。核心看点- 模型自由:支持 llama.cpp、Ollama、vLLM 等多种本地推理引擎,也兼容 OpenAI 兼容 API,切换只需改一行配置。 - 对话即上下文:选中代码后可直接提问、修改、解释,上下文自动包含相关文件,无需手动复制粘贴。 - 内置 RAG 能力:通过 @codebase 指令自动检索项目内相关代码片段,让大模型理解你的仓库结构。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁日常使用 VS Code 或 JetBrains 的开发者,尤其是对数据隐私敏感、希望离线编程或调试私有代码库的人。需要本地 GPU(或 CPU 推理)来运行模型,若使用云端 API 则需相应 Key。从 README 的快速开始示例出发,几分钟就能搭好第一条对话。更多自定义配置、自定义 Slash 命令和上下文提供器,值得去仓库的 Docs 与 Discussions 里翻一翻。马上体验:Continue 开源编程助手

GitHub项目

离线运行 Llama 3 的 C++ 推理引擎,llama.cpp 之外的新选择

如果你正在寻找一个比 llama.cpp 更轻量、更易嵌入的本地大模型推理方案,这个仓库值得一看。它用纯 C++ 实现了 Llama 3 的推理,无需 Python 环境,对资源敏感的场景(如树莓派、旧笔记本)尤其友好。核心看点- 极简依赖:仅依赖标准 C++ 库和 OpenBLAS,无需 CUDA 或 PyTorch,编译后二进制文件极小。 - 量化支持:内置 4-bit 和 8-bit 量化,能在 4GB 内存的机器上运行 7B 模型,推理速度可接受。 - 单文件可执行:下载预编译二进制或自己 make 即可运行,支持交互式聊天和一次性 prompt。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁本地开发者:想在自己项目里嵌入 LLM 推理,但不想引入 Python 或庞大的依赖链。边缘设备玩家:在 Jetson Nano、树莓派 5 上跑模型,需要极致精简的推理后端。学习推理原理者:代码结构清晰,适合阅读 C++ 版 Transformer 实现。仓库以 MIT 许可证发布,模型权重需从 Meta 官方获取,请遵守其许可。更多性能调优和内存占用细节,可以去 GitHub 仓库的 README 里翻一翻,Issues 区也有不少实战调参讨论。

GitHub项目

本地运行多模态大模型,llama.cpp 生态再添新成员

如果你还在为在消费级硬件上运行多模态大模型而发愁,这个仓库或许能让你眼前一亮。它基于 llama.cpp 的 GGUF 格式,让你可以在 CPU 或低显存 GPU 上跑起视觉语言模型,无需昂贵的 A100。对于想要本地体验 LLaVA、BakLLaVA 等模型的开发者和爱好者来说,这是个开箱即用的选择。核心看点- 低门槛推理:利用 llama.cpp 的量化能力,将 7B 参数的多模态模型压缩到 4-6 GB,普通笔记本也能运行。 - 原生支持多模态:不仅处理文本,还能直接接受图像输入并生成描述或回答,实现图文对话。 - 活跃社区维护:基于 MIT 许可证,近期仍有提交,Issue 和 PR 响应及时,适合二次开发或集成到自己的项目。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)上手提示推荐在 Linux 或 macOS 上使用,Windows 需配合 WSL。无需 GPU,但 16GB 以上内存能获得更好体验。无需任何 API Key,下载 GGUF 模型文件即可运行。如果你是本地 AI 应用开发者,或想离线使用多模态功能,这个仓库值得一试。感兴趣的话,直接去 README 查看快速开始和示例,还能找到社区预制的模型权重。仓库地址:llama.cpp 多模态扩展

GitHub项目

用自然语言操作本地文件?这个开源Agent框架做到了

如果你曾幻想过对电脑说“帮我整理桌面文件,把PDF按项目分类归档”,却苦于没有趁手的开源工具,那这个仓库值得你立刻点开。它让LLM直接接管文件系统、调用Shell命令,甚至操作浏览器,而这一切都在本地运行,无需上传隐私数据。核心看点- 自然语言驱动文件操作:支持“找到上周修改的图片并压缩”这类模糊指令,Agent自动解析意图并拆解为find、zip等底层命令,无需手写脚本。 - 模块化工具注册:内置文件读写、代码执行、网页抓取等工具,开发者可像搭积木一样扩展自定义工具(如数据库查询、API调用),依赖注入机制让集成成本极低。 - 多模型后端兼容:默认支持OpenAI兼容接口,也提供llama.cpp本地推理适配器,可在无GPU的笔记本上运行小模型(如Qwen2.5-7B),兼顾隐私与性能。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁- 开发者:快速为现有项目添加“语音/文本→自动化操作”能力,例如让运维机器人根据日志摘要重启服务。 - 普通用户:厌倦了重复性文件整理或批量重命名?装个本地模型就能当“数字管家”。 - Agent研究者:仓库提供了清晰的工具抽象层和任务编排示例,适合作为自定义Agent原型的起点。 - 依赖:Python 3.10+,无GPU也可运行(CPU推理速度较慢),默认无需API Key(若用本地模型)。最后,翻翻它的README,你会发现从“一句话压缩视频”到“自动生成周报”的完整案例。仓库的Issues里还有不少社区贡献的实用工具,比如微信文件自动归档。快戳 open-interpreter 看看能否成为你的效率外挂。

GitHub项目

用纯Go运行LLM?llama.go让你在CPU上本地跑大模型

如果你既想体验本地大模型推理,又不想被Python生态和GPU依赖绑住手脚,llama.go 是一个值得关注的选项。它用纯 Go 语言重写了 LLaMA 推理核心,无需 CUDA、PyTorch 或任何 Python 运行时,就能在 CPU 上加载并运行量化后的 LLaMA 系列模型,非常适合 Go 技术栈的开发者快速集成或二次开发。核心看点- 纯 Go 实现,零外部依赖:整个推理引擎仅依赖 Go 标准库和少量 C 代码(用于 mmap),编译后单二进制即可运行,部署极其轻量。 - 支持主流量化格式:可直接加载 GGUF 格式的量化模型(如 q4_0、q8_0),与 llama.cpp 生态兼容,无需额外转换工具。 - 交互式与 API 双模式:既提供命令行对话界面,也内置了兼容 OpenAI API 的 HTTP 服务端,方便接入已有应用。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁- Go 语言开发者:想在项目中嵌入本地推理能力,无需引入 Python 子进程或复杂环境。 - 边缘设备与资源受限场景:没有 GPU,但需要离线运行中小型模型(如 7B 参数量级)的推理任务。 - 学习推理原理的研究者:Go 代码结构清晰,适合阅读 LLaMA 推理的前向传播和 KV Cache 实现细节。如果你手头刚好有一台 CPU 机器,或者想探索 Go 在 AI 推理侧的潜力,不妨到 llama.go 仓库主页 下载 release 二进制试试看。项目采用 MIT 许可证,社区活跃度尚可,Issues 里也有不少实用的配置讨论。

GitHub项目

高效终端工具:ripgrep 快速搜索代码

ripgrep(rg)是一款基于 Rust 编写的命令行搜索工具,专为开发者设计,用于在目录中快速搜索文本模式。它比传统的 grep 快数倍,支持递归搜索、自动忽略 .gitignore 中的文件、以及丰富的正则表达式功能。其亮点在于跨平台兼容(Linux、macOS、Windows)和极低的内存占用,非常适合在大型代码库中定位字符串或函数定义。 该仓库由 Andrew Gallant 维护,拥有超过 5 万星标,许可证为 MIT 和 Unlicense 双许可,清晰且开放。近期提交活跃,持续修复 bug 并优化性能。无论是日常调试还是代码审查,ripgrep 都能显著提升效率,是 CLI 工具中的佼佼者。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准) 你可以通过 ripgrep 访问仓库,获取安装指南和文档。建议直接使用包管理器安装,体验无缝集成。

GitHub项目

打造高效终端:Starship 跨 Shell 快速提示符

如果你厌倦了默认终端提示符的单调与低效,Starship 正是你需要的现代化解决方案。这是一个用 Rust 编写的极简、高速、可定制的跨 Shell 提示符工具,支持 Bash、Zsh、Fish、PowerShell 等多种主流 Shell。它能在你键入命令时实时显示当前目录、Git 分支状态、编程语言版本、运行时间等信息,且所有配置都通过一个 TOML 文件完成,无需学习复杂的脚本语法。 Starship 的亮点在于其“开箱即用”的友好体验:安装后即可获得一个信息丰富且视觉美观的提示符,同时保持极低的性能开销(即便在大型 Git 仓库中也不会卡顿)。项目采用 Apache 2.0 许可证,近期提交活跃,社区贡献者众多,文档详尽,支持通过插件扩展功能。无论你是前端、后端开发者,还是 DevOps 工程师,Starship 都能显著提升终端操作效率。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准) 仓库地址:Starship。它已成为许多开发者的标配工具,值得立即收藏并融入日常工作流。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.