跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

Codex CLI:让 AI 直接在终端里改代码、跑测试

有些 AI 编程工具只敢给你生成补丁,Codex CLI 则直接接管终端里的脏活:你提任务,它自己查报错、改文件、跑测试,遇到要执行命令时会先征求同意。适合已经厌倦复制粘贴报错、想试试 Agent 式编程的开发者,尤其适合日常在本地仓库高频提交的工程向玩家。核心看点- 真正在项目里落地干活:不是对着聊天框生成一段代码就完事,而是本地读取文件、做修改、运行测试,再根据失败信息继续修,直到任务真正收敛。 - 把安全边界摆上台面:默认命令执行前要你审批,文件改动附带清晰 diff,想放权或收紧都能按需设置,不会让 AI 在仓库里横冲直撞。 - 接入路径比较自由:既能登录 ChatGPT 账号直接使用,也能配置自己的 API Key,还支持指向兼容 OpenAI 接口的自定义模型服务。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁最值的是已有 ChatGPT 订阅或 API 额度、又不想为 AI 编程换 IDE 的开发者。安装并不复杂,npm 或 Homebrew 都能搞定。仓库用 Apache-2.0 开源,README 里把鉴权、代理和审批模式写得很清楚;自带 Key 跑的话,顺手留意 token 消耗。想挑一个真实项目任务试试它到底能帮多少忙,直接照着 Quick Start 拉个最小复现即可——点开 Codex CLI 仓库看用法,剩下的交给它。

GitHub项目

Whisper.cpp:纯C++本地语音识别,轻量部署与离线推理利器

厌倦了云端语音识别的高延迟和隐私问题?Whisper.cpp 让你直接在笔记本或 Raspberry Pi 上运行 OpenAI 的 Whisper 模型,纯 C++ 实现,无需 Python 环境,启动即用。非常适合需要在边缘设备、嵌入式系统或离线场景下快速实现语音转文字的研究者和开发者。核心看点- 极致的轻量部署:整个项目编译后仅几 MB,内存占用比官方 Python 版低数倍,支持 INT4/INT8 量化推理,在低端硬件上也能流畅运行。 - 多模型格式与加速:原生支持 ggml 格式的 Whisper 模型,同时兼容 Core ML(Apple 芯片)、OpenVINO、CUDA 等后端,可以根据硬件灵活选择推理引擎。 - 丰富的接口与工具:除了命令行一键转写外,还提供 C API、Python 绑定以及 Web 示例,方便集成到各类应用中,比如实时字幕、语音助手等。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示- 环境要求:C++11 以上编译器,CMake 3.10+。无需 GPU,纯 CPU 即可运行,但配备 Apple M 系列芯片或 NVIDIA GPU 能获得加速。 - 获取模型:首次使用会通过 models/download-ggml-model.sh 自动下载 tiny/base/small 等尺寸的模型,默认 tiny 模型在 M1 Mac 上可达实时速度。 - 注意事项:项目采用 MIT 许可证,模型权重需参考 OpenAI 的许可条款;支持的语言与官方 Whisper 一致(已测试中英文)。快去仓库 Releases 页面下载预编译二进制,或直接 clone 编译试试:用命令行 ./main -m models/ggml-tiny.bin -f audio.wav 就能看到实时转写结果。完整用法和优化配置都在 whis…

GitHub项目

SWE-agent:让 LLM 自动修 GitHub Issue 的智能体框架

开发者最头疼的日常之一:打开 Issue 列表,面对一堆复现步骤和报错日志。SWE-agent 直接把 LLM 变成了能读代码、写补丁、跑测试的“虚拟工程师”——给定一个 GitHub Issue,它能自主理解仓库结构、编辑文件、执行命令,最终提交修复 PR。适合想用 AI 自动化代码维护的团队、研究 LLM 工具调用能力的开发者,以及任何被 Issue 淹没的开源维护者。核心看点- 端到端 Issue 修复:输入 Issue 链接,智能体会自动克隆仓库、定位相关文件、生成 diff 补丁,甚至尝试运行测试验证修复是否正确。实测在 SWE-bench 基准上达到 12.3% 的解决率(2024 年初数据),远超之前的方法。 - 可定制的 Agent-Computer 接口:框架将 LLM 与 Linux 环境(bash、文件系统、编辑器)解耦,你可以替换底层模型(GPT-4、Claude 等),或自定义工具集——比如只允许读取代码而不允许执行。 - 完整的反馈循环:每次代码编辑后,Agent 会读取错误输出或测试结果,迭代修改直到通过。整个过程透明可追溯,所有交互日志都保存在本地。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 想用 LLM 自动化代码 BUG 修复的团队,需要 README 中的 Docker 环境(无需 GPU,但推荐 16GB+ RAM)。 - 研究 Agent 工具调用与规划的研究者,仓库提供了详细的论文复现脚本和评估数据集。 - 注意:目前主要面向 Python 代码库,且需要 GitHub 令牌(用于克隆仓库)和 OpenAI / Anthropic API Key。想立刻让 LLM 帮你修一个 Issue?直接访问仓库首页 SWE-agent,用 pip install sweagent 开始体验。别忘了先看 examp…

GitHub项目

对话式AI开发利器!NVIDIA NeMo帮你快速构建定制LLM应用

如果你正为如何高效搭建支持多轮对话、知识检索的 AI 应用而头疼,NVIDIA 的 NeMo 框架会是一个值得试试的选择。它专为对话式 AI 场景设计,集成了训练、微调、推理和服务全套能力,对研究者和工程团队都很友好。核心看点- 端到端一站式:从数据处理、模型训练到部署推理,NeMo 提供了统一的工具链,省去拼凑多个库的麻烦。 - 多模态与多语言支持:除了文本对话,还集成了语音识别(ASR)、语音合成(TTS)和图像理解模块,适合构建更自然的交互体验。 - 大规模分布式训练:基于 NVIDIA 的优化,能高效利用多 GPU 集群进行预训练或 LoRA 微调,社区持续在贡献新模型和 checkpoint。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁主要面向有一定深度学习基础的开发者或研究人员,希望快速验证对话式 AI 原型或定制企业级应用。需要 Python 3.8+ 和 CUDA 环境,推荐使用 NVIDIA GPU 以获得最佳体验。框架本身是 Apache-2.0 许可证,模型权重需遵循各自许可。如果你想把 RAG、多模态、语音交互整合到一个相对成熟的工程框架里,不妨仔细翻翻它的 README 和示例,很多细节都在 NVIDIA NeMo GitHub 仓库 里藏着。

GitHub项目

Tabby 自部署的 AI 代码助手,终结 Copilot 隐私焦虑

如果你正在用 GitHub Copilot 却担心代码被上传,或者想在离线环境里也能有智能补全,Tabby 就是你一直在等的那个开源方案。它让你完全掌控自己的代码补全和聊天助手,只需一台带 GPU 的服务器(甚至可以使用 CPU 跑),就能获得媲美 Copilot 的体验。核心看点- 全链路自托管:从模型、后端到前端界面,所有组件都在你控制之下,不向任何第三方发送代码片段。支持 Ollama、vLLM 等多种推理后端,灵活切换模型(StarCoder2、CodeLlama 等)。 - 多 IDE 原生插件:VS Code、JetBrains、Neovim、Vim 主流编辑器全覆盖,安装即用。除了补全,还内置了内联代码聊天,无需切到网页就能问问题。 - 性能优先:核心用 Rust 编写,启动快,资源占用低。支持流式推理和连续补全,延迟控制在百毫秒级。还提供完整的 Prometheus 指标,方便自建监控告警。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合有自建服务器或私有云的公司团队,以及对代码隐私要求严格的安全敏感项目。单开发者也可以在一台个人笔记本上部署(推荐至少 16GB 内存 + 一块消费级 GPU)。项目已发布 Docker 镜像,部署教程在 README 里写得很详尽,不用折腾环境配置。如果你正在评估离开 Copilot 的替代方案,不妨去 Tabby 的 GitHub 仓库 看看它的 roadmap 和最近一周的 issue 讨论,社区挺活跃的,很多新特性都是用户 PR 贡献的。开源社区值得关注。

GitHub项目

用思维链让本地小模型变聪明——COT 推理增强库 Thought 开源

当本地小模型面对复杂推理任务频频翻车时,Thought 提供了一种轻量级解决方案:通过结构化的思维链(Chain-of-Thought)提示编排,显著提升 7B-13B 参数模型的逻辑推理能力,而无需任何微调。它特别适合想在低算力环境下榨干模型潜力的开发者。核心看点- 零训练推理增强:无需 GPU 微调,仅通过动态构建思维链提示模板,即可在数学、常识推理等任务上看到 10-20% 的准确率提升,兼容 Ollama、llama.cpp 等主流推理后端。 - 多策略集成:内置 Zero-shot CoT、Self-Consistency、Tree-of-Thought 等多种推理策略,可通过配置文件一键切换,方便对比效果。 - 极简 Python API:三行代码即可对任意 Hugging Face 模型或 OpenAI 兼容 API 进行推理增强,并自动输出结构化推理过程与最终答案。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 依赖:Python 3.9+,仅需 pip install thought,无强制 GPU 要求。 - 典型场景:本地模型做数学题、逻辑问答、代码 bug 分析等需要多步推理的任务。 - 注意:思维链会增加 Token 消耗,对于上下文窗口较小的模型(如 2K)需适当缩短输入。项目以 MIT 许可证发布,README 提供了完整的策略对比表格和 Jupyter Notebook 示例。如果你正为小模型的推理能力发愁,不妨试试这个轻量级外挂——去 Thought 仓库 看看如何用一行代码开启思维链。

GitHub项目

Wan2.2:MoE 架构的开源视频生成,本地也能跑起来

想在自己机器上做 AI 视频,却总被闭源 API 的排队和额度卡住?Wan2.2 把通义万相的视频生成权重、推理代码和 ComfyUI 玩法一起开源了,做短片、做概念验证的创作者,还有爱折腾本地模型的开发者,都可以直接上手。核心看点最先值得看的是 MoE 架构:把采样过程的高噪声与低噪声阶段交给不同的专家模型,画质和运动连贯性比前代更稳。仓库同时放出了文生视频、图生视频(A14B)和更轻量的 TI2V-5B,后者面向消费级显卡,显存压力友好不少。官方还给出 Hugging Face diffusers 与 ComfyUI 两条集成路径,社区工作流跟得很快,不是丢个权重就完事。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示需要 NVIDIA GPU 和 Python 环境,权重从 Hugging Face 拉取,想省事可以直接照 README 里的 ComfyUI 流程走。注意模型权重有单独的使用条款,动手前先翻一遍仓库 LICENSE,商用场景以官方说明为准。README 里写了安装命令、显存参考和示例提示词,跑通第一条视频应该用不了太久。去 Wan2.2 仓库看看。

GitHub项目

Ragas:给RAG系统做体检的开源评估框架,开发者的Debug提效利器

如果你的RAG应用总出“答非所问”的幻觉,盲目调prompt或embedding就像在黑箱里打转。Ragas提供了一套结构化的评测指标(忠实度、答案相关性、上下文精度等),让你能量化知道哪里出了问题,而不是靠感觉迭代。核心看点- 端到端评估:覆盖检索(context recall/precision)和生成(faithfulness、answer relevancy),避免只看LLM输出而忽略检索质量。 - 无须人工标注:利用LLM自动生成测试集并打分,配合少量文档就能跑通评估流程,降低上手成本。 - 可与LangChain/LlamaIndex集成:把评估挂到现有pipeline里,每次修改后一键跑分,用数字追踪改进效果。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁正在构建或优化RAG系统的开发者、研究员。项目用Python 3.8+,依赖OpenAI或本地LLM(如通过Ollama)作为评估模型,无特殊GPU要求。API Key视评估模型而定,评测逻辑本身不需要额外秘钥。想给你的RAG应用装一个客观的“监工”?去仓库README看一下metric说明和示例,用pip install ragas就能开始跑第一轮评估:Ragas GitHub

GitHub项目

SwarmGPT:让多智能体协作自动化处理复杂AI任务

面对需要多步骤推理、跨平台调用或复杂数据处理的AI任务,单一大模型往往力不从心。SwarmGPT 提供了一个轻量级的框架,让你能轻松编排多个 Agent 进行协作,无需构建庞大的工程体系。核心看点极简的 Agent 编排逻辑:基于 OpenAI 官方 Swarm 理念优化,通过简单的函数调用和状态管理,实现 Agent 间的无缝交接与任务分解,代码可读性极高。原生多模型支持:不仅兼容 OpenAI,还良好支持本地部署模型,方便在成本敏感场景下落地。即插即用的工具链:内置丰富的常用工具接口,开发者可快速扩展自定义功能,解决特定领域的自动化难题。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)上手提示项目采用 MIT 许可证,商业化无忧。主要依赖 Python 环境,建议配合支持 Function Calling 的 LLM 使用。对于需要私有化部署的团队,结合本地模型即可快速搭建专属的多智能体工作流。想深入了解如何构建你的第一个多 Agent 应用,直接查看 README 获取详细教程。

GitHub项目

LiteLLM:一套API调用上百种大模型,开发者的多模型切换利器

如果你受够了每次换模型都要重写 SDK 调用代码,LiteLLM 就是那个能“一劳永逸”的轻量代理。它把 OpenAI、Anthropic、Cohere、HuggingFace 等各种大模型的 API 统一成 OpenAI 格式,你只需要改一个字符串就能切换底层模型,适合需要快速测试或生产环境中多模型兜底的开发团队。核心看点- 统一接口覆盖 100+ 模型:从 GPT-4、Claude 到本地部署的 Llama、Mistral,甚至 Azure、Bedrock 等企业端点,全部用同一套参数调用。 - 内置 fallback 与重试机制:当一个模型超时或限流时自动切换到备用模型,不用自己写复杂的重试逻辑。 - 成本与用量透明:支持自定义路由策略,可以在请求级别设定最大预算,避免意外跑单。项目采用 MIT 许可,Python 环境即可运行,依赖简单。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁后端工程师或 AI 应用开发者,正在做多模型集成、A/B 测试、或希望为不同任务(如翻译 vs 代码生成)分配不同模型以控制成本。不需要 GPU,仅需 Python 3.8+,但若要代理本地模型需要搭配 Ollama 或 vLLM 使用。想省掉重复造轮子的时间?直接看 LiteLLM 的 README 和快速入门示例,十分钟就能接入你的项目。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.