跳到内容

夜深了,注意休息,愿你今夜好梦。

  • 6 回复
  • 835 浏览

视频号鸡汤看吐,翻到个白嫖GPU跑大模型的项目

参与讨论

长辈群转的视频号鸡汤实在看不下去。最近发现个能嫖Google Colab免费GPU跑大模型的脚本——Notion QA,fork下来改个API key就能跑。部署简单:装python依赖,设个notion token,直接query。踩坑是免费显存只够跑7B模型,再大就OOM。

讨论区

按楼层回复,支持引用与表情;使用 @用户名 或 @昵称 可提醒对方;发言计入圈子贡献字数。

6s 条评论

  1. 咖啡续命中
    咖啡续命中 成长10.6k

    @安全佬路过 那OpenLLM量化8B到6G确实香,ollama直接一条命令就能拉qwen2.5跑,省事多了 ollama

  2. 午后续命水
    午后续命水 成长9,188

    回复 @安全佬路过:这项目我试过,7B模型跑文档摘要还行。显存不够可以换Hugging Face Spaces嫖CPU推理,慢但能跑。

  3. 安全佬路过
    安全佬路过 成长9,731
    引用 午后续命水

    回复 @安全佬路过:这项目我试过,7B模型跑文档摘要还行。显存不够可以换Hugging Face Spaces嫖CPU推理,慢但能跑。

    @午后续命水 Hugging Face Spaces CPU慢得离谱,7B模型跑个摘要能等两分钟。不如上这个 OpenLLM,本地量化8B模型显存压到6GB,速度还行。

  4. 十万加在逃
    十万加在逃 绽放16.2k
    引用 安全佬路过

    @午后续命水 Hugging Face Spaces CPU慢得离谱,7B模型跑个摘要能等两分钟。不如上这个 OpenLLM,本地量化8B模型显存压到6GB,速…

    这OpenLLM看着还行,量化8B显存压到6G算实用。之前搞过这个 llama.cpp ,本地量化跑起来也挺顺。

  5. Debug到秃头
    Debug到秃头 绽放12.1k
    引用 安全佬路过

    @午后续命水 Hugging Face Spaces CPU慢得离谱,7B模型跑个摘要能等两分钟。不如上这个 OpenLLM,本地量化8B模型显存压到6GB,速…

    @安全佬路过 OpenLLM 量化 8B 到 6G 确实能跑,但注意它依赖 transformers 4.36+,老版本会炸。另外 llama.cpp 的 llama-server 有个坑——默认 max-tokens 只有 256,跑长文本得手动加 --ctx-size。

  6. 强迫症晚期
    强迫症晚期 成长11.7k
    引用 Debug到秃头

    @Debug到秃头 那个max-tokens坑我也踩过,加个--ctx-size 4096就完事。另外TinyLlama挺好,1.1B随便白嫖跑

发表评论

登录后发表评论

登录即可参与楼层讨论,支持引用回复与 @ 提醒。

前往登录页

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.