跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

想用自然语言写脚本?gptscript 让 AI 直接调度 API 与工具

写脚本时常常要查文档、拼参数,gptscript 想改变这件事:用一段自然语言描述你要做什么,它就能自动调用大模型来拆解任务、执行 API 调用和本地工具。对开发者来说,这意味着可以把日常自动化、数据查询、甚至 CI/CD 流程写成可读的“描述”,而不是堆代码。仓库采用 Apache-2.0 许可,README 清晰地列出了安装、运行和自定义工具链的步骤,最近还在持续加新功能和修复 issue。核心看点- 自然语言驱动:只要用英文描述目标(比如“下载最近 10 条 GitHub Release 信息并汇总成邮件”),gptscript 就会自动规划步骤、调用内置或自定义的工具完成,不需要手写 curl 或 Python 胶水。 - 可扩展的工具生态:支持接入任意 HTTP API、脚本、甚至第三方 Agent,开发者可以把自己的本地命令或微服务注册为 gptscript 的“工具”,复用性很强。 - 运行透明可调试:命令行模式下会打印每一步的推理过程和工具调用详情,方便你理解它到底做了什么,也方便修正 prompt 或工具描述。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁后端/DevOps 开发者、AI 应用原型师,以及任何希望通过自然语言快速编写自动化脚本的人。依赖很简单:只需要一个 Python 3.10+ 环境,以及一个 OpenAI API Key(或兼容接口),无需 GPU。第一次试用可参考仓库里给的“5 分钟快速开始”示例。用 gptscript 写脚本就像跟同事交代任务——试试看修改描述里的措辞,还能得到完全不同的执行路径。详细用法和工具注册方法都在 gptscript 官方仓库的 README 里,值得花几分钟翻一翻。

GitHub项目

Gradio:把模型快速包装成可分享的Web演示

很多人在本地跑通模型后,最头疼的是怎么让同事或朋友也能上手试。Gradio 就是干这个的:写几行 Python,把推理函数包成带界面的网页应用,还能生成临时链接发给别人。适合刚搭好模型的开发者,也适合需要给团队快速做 Demo 的研究者。核心看点- 代码量极少:用 gr.Interface 包住模型函数,自动生成输入输出控件,文本、图像、音频、视频都支持;多模态模型也能直接对接。 - 自带排队与并发:内置请求队列和批量推理机制,多用户同时访问时不会把本地服务压垮,体验比裸 Flask 顺手得多。 - 组件生态丰富:ChatInterface 专门做对话机器人,Blocks 可以自由拼装复杂交互页面,Hugging Face Spaces 也内置 Gradio 支持,一键部署分享。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁想快速给模型做内部评估的算法工程师、需要交课程项目的学生,以及喜欢把想法变成可玩原型的 AI 爱好者。本地安装 pip install gradio 就能跑,不需要前端知识,也不强制要求 GPU;想生成公网分享链接的话,依赖 Gradio 官方托管或内网穿透服务。想深入折腾组件和布局,建议去 Gradio 的 README 和案例区 逛一圈,里面有不少可以直接改来用的示例代码。

GitHub项目

RAG 新范式:用 GraphRAG 实现知识图谱驱动的检索增强生成,告别简单向量搜索

当传统 RAG 在复杂关系推理上频频碰壁时,GraphRAG 通过将知识图谱与 LLM 结合,让检索不再只是“找相似段落”,而是能沿着实体关系链进行多跳推理。这个仓库由微软研究院开源,提供了完整的 pipeline:从文档中自动抽取实体与关系、构建图索引、再到基于社区的问答生成,特别适合处理需要跨文档、多实体关联的深度知识问答场景。核心看点- 超越向量搜索:不是简单用 Embedding 做相似度匹配,而是构建 实体-关系图,支持全局性、聚合性的查询(如“这些文档中反复出现的关键主题是什么?”)。 - 自动图谱构建:利用 LLM 从原始文本中提取实体、关系和协变量,生成模块化的图结构,无需人工标注。 - 社区级问答:通过 Leiden 算法对图进行层次化社区划分,每个社区自动生成摘要,实现从局部到全局的多粒度回答,比传统 RAG 更擅长处理“总结性”问题。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 需要 Python 3.10+ 和 OpenAI API Key(或兼容端点),本地运行对内存有一定要求(建议 16GB+)。 - 仓库提供了 graphrag.index 和 graphrag.query 两个核心命令,README 中附有完整的使用示例和输出格式说明。 - 许可证为 MIT,社区活跃,Issue 区有大量关于图参数调优和中文文本适配的讨论,值得参考。对知识密集型应用(如企业文档库、科研综述、法律案例检索)的开发者来说,GraphRAG 提供了一条值得深入探索的技术路径。更多细节和配置指南请移步仓库 microsoft/graphrag。

GitHub项目

exo:把闲置的手机和旧电脑,拼成一个能跑大模型的集群

手里有旧笔记本、Mac mini,甚至一台吃灰的安卓机,可单机显存怎么也不够跑大模型——exo 想解决的就是这件事:把同一网络下的多台设备组成一个推理集群,让模型按层切到不同机器上跑。适合家里有闲置硬件、又想本地玩大模型的开发者和折腾党。核心看点- 自动发现组网:同局域网内的设备能互相识别,省掉手写 IP、端口和拓扑的麻烦。 - 异构混搭:Apple Silicon 与 Linux 设备可以放进同一个集群,按各自算力分担不同层。 - 开箱可用的交互:自带类 ChatGPT 的本地界面,后端对接 MLX、llama.cpp 等推理路径,常见开源模型基本能直接加载。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁典型场景是:家里有几台性能一般但联网方便的机器,想凑出更大可跑参数量,而不打算买一张大显存显卡。多机协作对局域网稳定性比较敏感,各设备需要装好 Python 环境和对应后端依赖;模型权重得自己下载,具体授权以仓库 LICENSE 和模型自身的许可条款为准。README 里列了设备支持情况和启动命令,想先看看自己手头的设备能不能凑一桌,直接翻 exo 仓库的说明文档 更快。

GitHub项目

Open Notebook:自建 NotebookLM,资料变播客

NotebookLM 好用,代价是资料得放在别人服务器上。open-notebook 把类似体验搬回自己的机器:PDF、网页、音视频链接丢进去,边读边追问,还能生成两个人对谈的播客音频。做课题研究、课程整理、内容选题的人可以直接点开。核心看点多源收料:PDF、网页、Office 文档、视频链接都能进库,自动转写、切分、建索引,省掉手搓文本那一步。边问边溯源:可以限定在某个来源范围内对话,回答带引用,随时翻回原文核对,比纯聊天踏实。一键出播客:把选定资料转成两个 AI 主播的对谈音频,通勤路上听自己攒的料。▲ github.com(阿里云通义万相 生成配图,非网页截图)自托管:Docker 拉起服务,数据留在自己的机器或服务器;模型既接云端接口,也能指向本地推理服务。上手提示需要 Docker 环境,启动后在设置里填入模型 API Key(或改用本地兼容接口)。首次索引大文件会慢一些,建议先拿一两个文档把流程跑通再批量导入。项目采用 MIT 许可证,接入的模型与嵌入服务条款请以各自官方说明为准。想先看看界面长什么样、播客效果如何,去 open-notebook 仓库 翻一遍 README 和 Releases 就够了。

GitHub项目

OlmoOCR:高保真PDF转文本,RAG解析不头疼

很多搭 RAG 管线的人,最后都会卡在 PDF 解析上:扫描件、双栏、错位表格,喂给模型全是乱码。OlmoOCR 是艾伦 AI 研究所开源的高保真 PDF 转文本/HTML 工具,专治这种「文档预处理」难题,适合在搭知识库、做文档解析的开发者或研究者。核心看点它把扫描 PDF 直接变成可用的干净文本,能读懂复杂版面,表格、双栏、多级标题大体能按原顺序输出,而不是简单切块。更重要的是,不只给纯文本,还能转出 HTML,把粗体、斜体、页码这类结构信息保留下来,下游 RAG 或者网页渲染用起来更舒服。项目以 Apache-2.0 开源,推理流程可自托管,模型权重和代码都在,只要有 GPU 就能把数据留在自己手里。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁适合正在做 RAG、文档问答、批量档案数字化的工程师和研究者。它默认会下载多模态模型权重,建议至少准备一张 NVIDIA GPU,具体显存、依赖版本以仓库 README 为准;不需要任何付费 API Key,自己部署就能跑。想判断它能不能处理你手头那堆扫描件,直接去 OlmoOCR 仓库 看 README 里的效果示例和命令行样例,或者带着真实文档去 Issues 里问维护者。

GitHub项目

CrewAI:多Agent协作框架让AI团队像人类一样分工

还在为单个大模型无法完成复杂任务而烦恼?CrewAI 帮你组建一支「AI 特工队」——通过角色定义、任务分配和流程编排,让多个 Agent 像人类团队一样协作完成端到端工作流。无论是写代码、做调研还是生成报告,它都能让每个 Agent 各司其职,省去你手动调度模型的麻烦。核心看点- 角色化 Agent 设计:为每个 Agent 分配角色(如研究员、写手、审核员)、目标和背景故事,让模型行为更可预测,协作更自然。 - 灵活的流程控制:支持顺序执行、层级管理和自定义路由,轻松编排复杂任务链,还能嵌入工具调用(搜索、API、代码执行)。 - 轻量且可扩展:基于 Python,依赖简单,可无缝对接 OpenAI、Anthropic 或本地模型(通过 Ollama),适合快速原型到生产部署。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- 开发者:想快速搭建多 Agent 应用(如自动化报告生成、客服系统),无需从零设计编排逻辑。 - 研究者:试验多 Agent 协作模式(如辩论、共识机制),CrewAI 提供开箱即用的角色与记忆模块。 - 爱好者:在本地用 Ollama 跑开源模型,体验 Agent 团队如何协同工作。无需 GPU,普通 CPU 即可运行小模型。CrewAI 的文档和示例仓库非常完善,从「Hello World」到复杂工作流都有保姆级教程。建议直接去 GitHub 看示例代码和社区讨论,感受一下多 Agent 协作的魔力:CrewAI 仓库

GitHub项目

Qwen2.5:阿里通义千问新一代开源大模型,多尺寸与长上下文

如果你正在寻找一个既能跑在消费级显卡上、又能处理超长上下文的开源大模型,Qwen2.5 系列值得你立刻点开。阿里云通义千问团队最新发布,覆盖从 0.5B 到 72B 共 7 个尺寸,全部开源且支持 128K tokens 上下文,Apache-2.0 许可,无论是研究实验还是生产部署都能找到合适的版本。核心看点- 全尺寸覆盖与灵活部署:从 0.5B 的轻量级模型(适合手机或端侧推理)到 72B 的旗舰版本(需要多卡 GPU),中间还有 1.5B、3B、7B、14B、32B 等梯度,开发者可根据硬件和场景自由选择。 - 超长上下文与多语言能力:原生支持 128K tokens 上下文窗口,且在多语言基准(包括中文、英文、代码、数学)上表现优异,尤其适合需要处理长文档、对话历史或代码库的 RAG/Agent 应用。 - 开源生态友好:模型权重已在 Hugging Face 和 ModelScope 发布,兼容 vLLM、llama.cpp、Ollama 等主流推理框架,微调也可直接接入 LLaMA-Factory,上手门槛极低。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 依赖与硬件:最小 0.5B 模型可在 CPU 或 4GB 显存的 GPU 上运行;72B 推荐使用 4×A100(80GB)或更高配置。无需 API Key,全部离线部署。 - 典型场景:长文档问答、代码生成与修复、多轮对话 Agent、本地知识库 RAG 系统。建议优先尝试 7B/14B 版本,在效果与资源消耗间取得平衡。 - 快速开始:通过 transformers 或 vLLM 加载模型,参考仓库 README 中的示例代码即可在 5 分钟内跑通推理。更多细节(如微调脚本、量化配置、Benchmark 结果)都写在仓库的文档里,建议直接去 README 的“模型列表”与“快速…

GitHub项目

离线运行 Llama 3 的 C++ 推理引擎,llama.cpp 之外的新选择

如果你正在寻找一个比 llama.cpp 更轻量、更易嵌入的本地大模型推理方案,这个仓库值得一看。它用纯 C++ 实现了 Llama 3 的推理,无需 Python 环境,对资源敏感的场景(如树莓派、旧笔记本)尤其友好。核心看点- 极简依赖:仅依赖标准 C++ 库和 OpenBLAS,无需 CUDA 或 PyTorch,编译后二进制文件极小。 - 量化支持:内置 4-bit 和 8-bit 量化,能在 4GB 内存的机器上运行 7B 模型,推理速度可接受。 - 单文件可执行:下载预编译二进制或自己 make 即可运行,支持交互式聊天和一次性 prompt。▲ github.com 仓库页截图(仅供参考,以 GitHub 为准)适合谁本地开发者:想在自己项目里嵌入 LLM 推理,但不想引入 Python 或庞大的依赖链。边缘设备玩家:在 Jetson Nano、树莓派 5 上跑模型,需要极致精简的推理后端。学习推理原理者:代码结构清晰,适合阅读 C++ 版 Transformer 实现。仓库以 MIT 许可证发布,模型权重需从 Meta 官方获取,请遵守其许可。更多性能调优和内存占用细节,可以去 GitHub 仓库的 README 里翻一翻,Issues 区也有不少实战调参讨论。

GitHub项目

VideoLingo AI 视频翻译配音全自动,生肉剧集轻松啃

追生肉、剪课程、做二创时,字幕和配音总是最磨人的一步:手动切时间轴,机翻腔又没温度。VideoLingo 把语音识别、翻译、打轴、配音串成一条自动化流水线,适合外语学习者、视频 UP 主和不想折腾复杂命令行的普通玩家。核心看点- 全流程一体:从视频提取语音到生成字幕、翻译、配音,一条命令跑完,不用在多个工具间反复横跳。 - 翻译有「人味」:不是简单逐句机翻,而是结合上下文润色,出来的字幕读着顺,配音听感也更自然。 - 部署伸缩自由:本地有简易操作界面,API Key 和本地模型都支持,从尝鲜到批量处理都能覆盖。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁外语学习者、剪辑师、追剧党,以及想做海外面签视频的中长尾创作者。需要准备对应模型的 API Key(如 OpenAI 或 Anthropic),也可改用本地推理;具体依赖和许可证以仓库 README 为准。想看看实际效果和配置步骤,直接去 VideoLingo 的 README 对照着跑,比自己猜快得多。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.