跳到内容

夜深了,注意休息,愿你今夜好梦。

GitHub项目

共 149 篇文章

GitHub项目

想用自然语言写脚本?gptscript 让 AI 直接调度 API 与工具

写脚本时常常要查文档、拼参数,gptscript 想改变这件事:用一段自然语言描述你要做什么,它就能自动调用大模型来拆解任务、执行 API 调用和本地工具。对开发者来说,这意味着可以把日常自动化、数据查询、甚至 CI/CD 流程写成可读的“描述”,而不是堆代码。仓库采用 Apache-2.0 许可,README 清晰地列出了安装、运行和自定义工具链的步骤,最近还在持续加新功能和修复 issue。核心看点- 自然语言驱动:只要用英文描述目标(比如“下载最近 10 条 GitHub Release 信息并汇总成邮件”),gptscript 就会自动规划步骤、调用内置或自定义的工具完成,不需要手写 curl 或 Python 胶水。 - 可扩展的工具生态:支持接入任意 HTTP API、脚本、甚至第三方 Agent,开发者可以把自己的本地命令或微服务注册为 gptscript 的“工具”,复用性很强。 - 运行透明可调试:命令行模式下会打印每一步的推理过程和工具调用详情,方便你理解它到底做了什么,也方便修正 prompt 或工具描述。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁后端/DevOps 开发者、AI 应用原型师,以及任何希望通过自然语言快速编写自动化脚本的人。依赖很简单:只需要一个 Python 3.10+ 环境,以及一个 OpenAI API Key(或兼容接口),无需 GPU。第一次试用可参考仓库里给的“5 分钟快速开始”示例。用 gptscript 写脚本就像跟同事交代任务——试试看修改描述里的措辞,还能得到完全不同的执行路径。详细用法和工具注册方法都在 gptscript 官方仓库的 README 里,值得花几分钟翻一翻。

GitHub项目

llm.c:几百KB C代码跑GPT-2,Karpathy手把手拆解训练

想搞懂大模型训练时那些反向传播、梯度下降到底在干什么?Karpathy 的 llm.c 把 GPT-2 的推理和训练压缩进一个纯 C 文件,不装 PyTorch 也能跑起来。适合想从框架里跳出来、亲眼看看 Transformer 每一步计算的开发者,也适合研究生或爱好者拿来做实验底稿。核心看点- 纯 C 实现:没有 Python 依赖,CPU 上即可编译运行;GPU 版用 CUDA 写出可对比的 kernel,让你看清 PyTorch 里那些『魔法』本质。 - 完整训练流程:不是玩具,它包含数据加载、前向、反向、AdamW 优化器,真正训练出可用的小规模 GPT 模型。 - 自带参考实现:仓库同时提供 PyTorch 参考代码,方便对照 C 版本验证数值和梯度,理解每层数学推导。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示适合机器不太够用的同学:单张消费级显卡甚至纯 CPU 都能跑通小配置,只需装好 C 编译器和 CMake;不必申请任何 API Key。想立刻动手,先跑 ./run.sh 或按 README 指引编译,然后观察 loss 下降。如果你想复现更大的 GPT-2 规模,建议使用带 CUDA 的 NVIDIA 显卡,显存越大越省心。想自己修改注意力机制或换数据集,仓库结构很短,读代码比查文档快。具体依赖、复现脚本和已知问题都在 llm.c 的 README 里,最近提交仍在更新,值得点进来看一眼。

GitHub项目

Aider:终端AI结对编程,多模型+自动Git提交真香

如果你经常在命令行里写代码,又想让大模型帮你改bug、加功能,Aider值得一试。它把AI助手直接嵌进终端,你只需要用自然语言描述需求,Aider就能读懂项目上下文,替你做编辑,甚至自动生成Git提交——连git commit -m都不用敲。核心看点-全栈上下文感知:Aider会扫描你的仓库结构、文件内容,结合Git历史和对话记忆,理解代码意图再下手改,不是那种“改完跑不通”的盲改。 -模型自由:默认支持OpenAI、Anthropic、Google Gemini等闭源模型,也能切换本地模型(通过Ollama或vLLM)。如果换了模型,整个会话会自动调整角色设定,体验很丝滑。 -天然Git集成:每次AI修改都会自动生成独立commit,方便你用git revert回滚。如果某次改崩了,直接抛弃那个commit就行,心理负担小很多。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示安装只要一行pip install aider-chat,然后在项目目录下运行aider,第一次会引导你配置API Key。建议准备一个OpenAI或Anthropic的API Key来体验完整功能;如果本地有GPU,也可以用Ollama跑CodeLlama等模型(速度会慢些,但免费)。Aider会自动识别项目语言,Python、JavaScript、Go、Rust等主流语言都支持得不错。Aider的README写得特别详细,还附了一个真实项目的demo视频,看完基本就上手了。建议去仓库的Releases看最新变化,或者Issues里翻翻别人踩过的坑,比自己摸索快很多。

GitHub项目

Open Lovable:AI克隆任意网站的前端项目

如果你厌倦了从零手写前端页面,或者想把某个网站的UI快速复刻成React应用,Firecrawl团队开源的Open Lovable值得一试。这个项目让你通过自然语言与AI对话,直接构建完整的React应用;更酷的是,它能够克隆任何现有网站并原地生成现代React代码,整个过程几乎在秒级完成。仓库采用TypeScript(94.9%)为主,基于Next.js搭建,适合前端开发者、AI应用探索者以及想快速验证产品原型的团队。核心看点- 对话式开发:在聊天界面用日常语言描述需求,AI自动生成React组件和页面逻辑,无需手写样板代码。 - 网站克隆与重构:粘贴任意URL,系统抓取页面结构并输出可维护的React项目,特别适合做竞品分析、设计灵感迁移或快速搭建初始版本。 - 本地运行友好:项目明确提供了bun.lock和.env.example,克隆后简单配置即可在localhost:3000启动,开发者可以自由修改和扩展底层逻辑。适合谁▲ Open Lov…(阿里云通义万相 生成配图,非网页截图)- 前端开发者:需要快速验证想法或从现有站点抽取UI,Open Lovable能大幅缩短初始搭建时间。 - AI工具爱好者:想研究如何将大模型与代码生成、网页抓取结合,仓库代码结构清晰(components/、hooks/等),适合作为学习样板。 - 产品与设计团队:需要快速生成可交互的React原型,无需等待完整设计稿。注意:项目依赖Node.js环境,官方推荐使用bun包管理器;运行时需申请对应的AI模型API Key(摘录未指定具体模型,建议查看仓库README.md获取详情)。项目的LICENSE已包含在仓库中,使用前请确认具体条款。如果你想亲手体验“一句话生成React App”或“秒级克隆任意网站”,不妨克隆仓库试玩,并去 Open Lovable 仓库 的Issue/Dis…

GitHub项目

MoneyPrinterTurbo:给个主题自动出短视频,值得一开

随手刷到一条口播视频,觉得镜头语言一般但流量不低,自己也想批量试做?MoneyPrinterTurbo 的思路是把你丢进去的标题,自动变成脚本、配音、字幕和成片。适合想用 AI 做短视频内容又不想写代码的自媒体爱好者,也适合想观察整套生成管线的开发者。核心看点- 从标题到成片串成流水线:不用手动一段段剪,填个主题让大模型撰稿,再转成语音并合成视频,常规口播内容能省下不少机械操作。 - 模型和语音环节可替换:后端脚本生成、TTS 那两段都会留配置入口,想接在线 API 还是本地推理都看自己需求,README 里也有对应说明。 - 既有界面也有 API 模式:闲时点鼠标操作,忙时把接口挂进自动化流程,二次开发不用绕太远。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示首次运行前,确认系统里装好了 Python 环境和 FFmpeg,再去看仓库里列出的配置项,比如语音服务、素材来源或大模型接口。它不一定非要 GPU 才能跑,但若你想在素材上有更多原创性,往往需要另外准备可用的视觉生成服务或素材 API Key。导入模型权重前也务必留意仓库 LICENSE,不要默认可以商用。这套工具强在“把短片生产流程串起来”,并不代表出来的内容可以直接发布。花点时间改脚本、挑素材,再用它做批量化输出,反而更稳。想判断要不要纳入自己的工具箱,直接去 MoneyPrinterTurbo 的 README 看安装方式与更新记录。

GitHub项目

ComfyUI:拖拽式节点工作流,AI 图像/视频生成利器

厌倦了每次跑 Stable Diffusion 都要记命令行参数?ComfyUI 把复杂流程变成可视化节点图——拖拽连接模块即可搭建文生图、图生图、ControlNet 甚至视频生成管线。无论你是想快速出图的设计师,还是需要精细控制每一层模型的开发者,这个仓库都能让你用更少代码做更多事。核心看点- 模块化节点系统:所有操作(模型加载、提示词输入、采样器、后处理)都是可拖拽的节点,自由组合,逻辑一目了然,方便调试和复用。 - 原生支持多模型生态:直接兼容 Stable Diffusion 系列、FLUX、AnimateDiff 等主流模型,无需额外适配;还能加载 LoRA、ControlNet、T2I-Adapter 等附加模块。 - 高效率与低门槛并存:基于 PyTorch,利用 GPU 加速,同时提供 Web UI 界面;社区贡献了大量现成工作流,导入即用,适合从新手到进阶用户。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示- 依赖:Python 3.8+,PyTorch,NVIDIA GPU(建议 8GB 以上显存);CPU 模式可用但速度较慢。 - 无需 API Key:完全本地运行,模型权重需自行下载(Hugging Face / Civitai),仓库以 MIT 许可证发布,放心使用。 - 典型场景:批量生成角色立绘、搭建 ControlNet 精准控制姿势/深度、组合 AnimateDiff 制作短视频片段。GitHub 仓库里不仅有完整安装指南,还有官方示例工作流和问题讨论区。直接点开 ComfyUI 体验节点式创作的快感吧。

GitHub项目

OpenWebUI:LLM 交互前端,让本地模型拥有 ChatGPT 级体验

如果你厌倦了在终端里敲命令行调用本地大模型,或者觉得 Ollama 的原生界面太简陋,那 OpenWebUI 就是你要找的答案。它把 llama.cpp、Ollama 等推理后端包装成一套漂亮、可扩展的 Web 界面,支持多模型切换、RAG 知识库、对话历史管理与插件系统,让本地模型体验直接对标 ChatGPT。核心看点- 开箱即用的多模型管理:支持同时连接 Ollama 和 OpenAI 兼容 API,可在同一界面内自由切换不同 LLM,方便对比效果。 - 内置 RAG 与文件上传:用户可上传 PDF、文档等文件,自动进行文本嵌入与检索,实现基于本地知识的问答,无需额外搭建向量数据库。 - 丰富的插件与权限体系:支持自定义工具链、用户分组、API 密钥管理,适合团队协作部署,也便于开发者二次扩展功能。▲ github.com(阿里云通义万相生成配图,非网页截图)上手提示推荐搭配 Ollama 或 llama.cpp 使用,只需 Docker 一键启动(docker run -d -p 3000:8080 ghcr.io/open-webui/open-webui),无需 GPU 也能跑通基础对话。若启用本地 RAG,建议至少 8GB 内存;若需联网搜索或调用付费模型,需准备相应 API Key。项目采用 MIT 许可证,社区活跃,Issue 响应快。从个人实验到团队知识库,OpenWebUI 把本地模型的门槛降到最低。不妨直接打开 OpenWebUI 仓库主页 看看 README 里的部署演示,五分钟就能拥有自己的 AI 聊天台。

GitHub项目

LlamaParse:RAG 场景下的智能文档解析利器

手头有一堆 PDF、PPT 或 Excel 文件想喂给大模型做 RAG,却总被混乱的排版、表格和图表搞到崩溃?LlamaParse 专为此而生——它是由 LlamaIndex 团队开源的文档解析引擎,能像人一样理解文档结构,把复杂内容干净地转为 Markdown,直接对接你的 RAG 流水线。核心看点- 高保真结构解析:内置视觉模型,能识别段落、标题、表格、列表和图表,输出整洁的 Markdown,而非杂乱文本碎片。 - 多格式支持:PDF、PPT、Word、Excel 等常见办公文档全覆盖,甚至可处理扫描件(需配合 OCR)。 - 云服务 + 本地部署双模式:提供免费 API(限速)和自托管选项,后者适合隐私敏感场景。▲ github.com(阿里云通义万相生成配图,非网页截图)适合谁- RAG 应用开发者:需要高质量文档输入来提升检索准确率的团队。 - 企业内部知识库搭建者:处理大量非结构化报表、合同、白皮书。 - AI 研究爱好者:想探索视觉语言模型在文档理解上的落地应用。依赖 Python 3.9+,API 模式无需 GPU,本地部署需至少 8GB 显存。LlamaParse 在 GitHub 上持续迭代,社区活跃度很高。去 LlamaParse 仓库 看看 README 和示例,几分钟就能集成到你的 RAG 流程里。

GitHub项目

CogVideo 开源视频生成模型,零门槛生成高清短片

如果你在找一款开源的文本到视频生成模型,CogVideo 值得你点开仓库。它来自清华团队,基于预训练的语言模型进行视频生成,不需要昂贵的商业 API,本地部署就能跑。对于想研究视频生成或者快速产出短视频原型的开发者来说,这是目前少有的高质量开源选择。核心看点- 多版本可选:官方提供了 9B 和 5B 参数的模型权重,兼顾效果与资源消耗。支持文本生成视频、图像生成视频两种模式。 - 高效推理架构:采用 VQ-VAE + Transformer 结构,结合 3D causal attention,能在 10 秒左右生成 4 秒 720×480 分辨率的视频(取决于显存)。 - 中文友好:模型对中文提示词理解较好,直接输入中文描述即可生成符合语义的视频,无需额外翻译。▲ github.com(阿里云通义万相 生成配图,非网页截图)上手提示部署需要至少 24GB 显存的 GPU(推荐 RTX 4090 或 A100),项目基于 PyTorch,通过 Hugging Face 下载权重。官方提供了详细的 Docker 镜像和 gradio demo,拉下来就能跑。无需 API Key,所有推理在本地完成。MIT 许可证,商用或二次开发都很自由。不过注意,当前版本生成的人脸细节和复杂动作仍有失真,适合做概念演示或辅助素材生成。建议先去 README 看看模型局限性和未来计划,说不定你的使用场景正好契合。仓库地址: CogVideo GitHub 仓库

GitHub项目

Quivr:用RAG打造你的第二大脑,私有知识库开源方案

如果你厌倦了把文档喂给ChatGPT后每次都要重复上传,或者担心数据隐私泄露,那Quivr值得你花两分钟看看。它是一个开源的“第二个大脑”,让你用本地或云端LLM构建私有RAG知识库,直接上传PDF、Markdown、代码文件甚至网页链接,就能像聊天一样检索内部信息。无论是个人笔记管理还是团队内部文档问答,都能用上。核心看点- 即插即用的RAG体验:内置文档解析、向量化存储与检索,支持Ollama、OpenAI等多种模型后端;无需手动写Embedding或向量库配置。 - 多模态输入与权限控制:不止文本,还可以拖入图片、音频(需模型支持),并提供简单的用户/群组权限,适合小团队协作。 - 数据完全自主可控:支持本地部署,用PostgreSQL + Supabase存储向量,无需把数据送进第三方SaaS,满足隐私偏好。▲ github.com(阿里云通义万相 生成配图,非网页截图)适合谁知识工作者、研究人员、小团队,或任何想将散落文档按语义组织起来的人。依赖Docker、Node.js,可自托管;若使用本地Ollama无需API Key,若用OpenAI则需自己的Key。MIT许可证,放心商用。上手不难:克隆后执行docker compose up,浏览器打开后台,上传文档即开始问答。更详细的使用技巧可以看看仓库的README和官方文档,社区也在Discord里活跃答疑。快去Quivr仓库里点个Star,给你的知识库加个AI引擎吧。

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.