尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

8G 显卡能跑多大模型:Ollama 实测 7B 到 14B 显存占用

发布时间:2026/9/27 15:03:36

资讯中心
01
ARTICLE

8G 显卡能跑多大模型:Ollama 实测 7B 到 14B 显存占用

8G 显卡能跑多大模型:Ollama 实测 7B 到 14B 显存占用
上礼拜我干了一件蠢事兴冲冲下了一个 9G 的模型一跑直接报错白等半天下载。要说本地大模型这东西最坑的不是装不上是显存没算清楚就乱下。今天就把我用 8G 显存的卡实测 7B 到 14B 的过程捋一遍踩过的坑一个不落。那晚我把显存干爆了我的卡是 8G 显存装好 Ollama 之后第一个就想试试 qwen2.5:14b。下载完兴冲冲敲了句 ollama run qwen2.5:14b结果等了十几秒屏幕上蹦出一行 CUDA error: out of memory。当时我人都傻了9G 的权重往 8G 的显存里塞能不爆吗。先摸清你手头有多少家底跑之前先把家底摸清楚。一个命令看显存nvidia-smi顶部 Memory 那栏就是显存大小和使用量。再看装了哪些模型ollama list。想知道某个模型多大用 ollama show qwen2.5:7b参数、量化、文件大小全列出来。我机器上装的是 Ollama 0.5.7。为什么显存会不够这里面的门道其实就一句话模型权重文件多大占的显存就有多大还得额外给 KV cache 和 CUDA 上下文留地方。我下的 14B 是 Q4_K_M 量化权重约 9G8G 显存根本塞不下。而 7B 的 Q4_K_M 权重才 4.7G 左右8B 大约 4.9G这才有戏。7B 档8G 卡的舒适区先跑 qwen2.5:7b。加载完切出去看 nvidia-smi显存占用 5G 上下还剩 3G 富余开着浏览器查资料完全没压力。出字速度跟得上人回消息的节奏日常写写草稿、理理资料够用了。这是 8G 卡最舒服的档位。8B 档能跑但有点挤接着试 llama3.1:8b权重 4.9G加载后显存占用爬到 6G 多。短对话没问题但让它读一篇长文章上下文一大KV cache 跟着涨就有点喘偶尔还报 out of memory。这时的土办法是把上下文缩小我在 Modelfile 里写 PARAMETER num_ctx 2048重建模型明显稳了。想临时改也可以设环境变量 OLLAMA_CONTEXT_LENGTH。14B 档爆了之后我试的两个土办法14B 不爆才怪爆了之后我不想白下载试了两个办法。1换更低的量化。qwen2.5:14b 默认的 Q4_K_M 是 9G换成 qwen2.5:14b-q2_K 只有 5G 多能塞进 8G 显存。代价是智商明显缩水说话一股省电味长一点的推理基本就废了。2只让显卡扛一部分层。写个 Modelfile第一行 FROM qwen2.5:14b第二行 PARAMETER num_gpu 20然后 ollama create 重新生成一个模型。这样前 20 层放显卡剩下扔 CPU显存占用下来了但速度慢得可以泡杯茶等它说一句话。两个办法都能跑但都不如直接选 7B 舒服。8G 卡到底该选多大模型我最后的结论就一句话8G 显存7B 是舒适区8B 是极限14B 靠降量化和拆层硬凑体验大打折扣。选模型之前先拿 ollama show 看看权重大小再留出 2G 给 KV cache基本就不会翻车。具体数字以你自己 nvidia-smi 实测为准毕竟 CUDA 版本和上下文设置都会影响占用。这篇是本地大模型系列第一篇后面我还会写 8G 显存怎么同时装几个模型、Ollama 和 LM Studio 到底选哪个都是我自己踩过坑的实操记录。想看后续就关注一下账号。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。