显存怎么选:24G、40G、48G、80G 的分水岭

先说结论:显存是选卡的第一硬指标

在选 GPU 这件事上,算力(TFLOPS)决定”跑得多快”,显存(VRAM)决定”跑不跑得起来”。两者优先级完全不同:算力不够,你把批次调小、训练时间拉长,任务最终还能完成;显存不够,模型在加载权重的那一刻就直接报 out of memory。所以在预算允许的范围内,选卡的正确顺序是”先看显存够不够,再看算力划不划算,最后看价格和平台”。

2026 年国内市场上,24G 的 RTX 4090 时租约 1.2-2.5 元,40G 的 A100 约 2.4-2.9 元,80G 的 H100/H800 国内约 9.6-12 元,国产昇腾 910B 提供 64G 显存。价格随容量阶跃式上升,但并非所有任务都要爬到阶梯顶端。这篇文章要解决的,就是帮你判断自己的模型落在哪一个档位,以及显存不够时除了加钱换卡还有哪些补救手段。

一句话版本:7B 级模型做推理,24G 通常够用;13B 到 30B 级模型微调,40G 或 48G 是舒适区;70B 级模型不量化就很难在单卡上跑,80G 只是起点而不是终点。

显存到底被什么占用

很多人以为显存只用来放模型权重,这是最常见的误解。实际上一张卡上的显存被至少四部分同时占用,任何一部分失控都会导致 OOM。

第一部分是模型权重。参数量乘以每个参数的字节数就是权重体积:FP16 精度下每个参数占 2 字节,所以 7B 模型约 14GB,13B 约 26GB,70B 约 140GB。这是最容易被估算的一部分,也是唯一可以靠量化显著压缩的一部分。

第二部分是激活值与梯度。训练时前向传播的中间结果必须保留到反向传播使用,批大小(batch size)和序列长度(sequence length)直接决定这部分的开销。同样一个模型,批大小从 1 调到 8,激活值可能翻好几倍。这也是为什么”这个模型我用 24G 能推理但训练就爆显存”——推理只需要权重加 KV cache,训练还要额外装下梯度和优化器状态。

第三部分是优化器状态。以 Adam 系列优化器为例,它要为每个参数额外保存一阶和二阶动量,全量微调下这部分开销往往是权重本身的数倍。这就是 LoRA 这类参数高效微调方法存在的根本原因:它只训练极少量新增参数,把优化器状态的开销压到几乎可以忽略,从而让 24G 卡也能微调 7B 级模型。

第四部分是推理场景下的 KV cache。自回归生成时每个已生成的 token 都要缓存注意力键值对,上下文越长、并发越高,这部分占用越大,长上下文场景下甚至可能超过权重本身。明白这四部分,你就知道显存需求不是”模型有多大”一个变量,而是”模型规模 × 精度 × 批次 × 上下文长度”的乘积。

占用来源 大致与什么成正比 训练时 推理时 主要压缩手段
模型权重 参数量 × 每参数字节 必须 必须 INT8 / 4-bit 量化
激活值 批大小 × 序列长度 × 层宽 必须 很小 梯度检查点、减小批次
优化器状态 参数量 × 倍数 全量微调必须 不需要 LoRA / 冻结底座
KV cache 层数 × 头数 × 上下文 × 并发 需要 对话类负载显著 量化 KV、限制上下文

量级表:不同规模模型要多少显存

下面这张表给出的是”量级区间”,用来说明档位关系,不是精确值。实际占用会随框架实现、精度、批次与序列长度浮动,参考时请按自己的配置留出余量。

模型规模 FP16 权重 4-bit 量化权重 推理起步显存 全量微调显存 LoRA 微调显存
7B 级 约 14GB 约 4-5GB 16-24G 档 需要 80G 档或多卡 24G 档可尝试
13B 级 约 26GB 约 7-9GB 24-40G 档 需要 80G 档起步 40G 档较舒适
30B 级 约 60GB 约 16-20GB 40-80G 档 需要多卡 40-80G 档
70B 级 约 140GB 约 35-40GB 需量化后 80G 档 需要多卡集群 80G 档起步

读这张表的正确方式是看”档位跳变”而不是记具体数字。7B 级模型是 24G 卡的上限区间,量化之后 24G 可以宽松地跑推理;13B 级模型量化后能在 24G 上跑,但会比较紧,40G 会明显从容;30B 级以上开始进入 40G 到 80G 的讨论范围;70B 级模型即使 4-bit 量化后权重也需要 35-40GB,单张 80G 能装下权重,但留给 KV cache 和激活值的空间并不宽裕,这直接决定了它的并发能力和上下文长度都受限。这就是”80G 只是起点”的含义。

分水岭一:24G 能干什么、不能干什么

24G 是当前国内供给最充足、价格最亲民的显存档位,RTX 4090、4090D、3090 都是 24G。它的能力边界相当清晰。

能做的:7B 到 13B 级模型的推理服务;7B 级模型的 LoRA 微调;AIGC 出图(Stable Diffusion 系列)与视频生成的轻量场景;中小规模的传统视觉模型训练;嵌入模型、重排序模型的批量推理。

勉强的:13B 级模型的 LoRA 微调,需要把批大小压到很小并开启梯度检查点,训练速度会明显变慢;长上下文推理(比如 32K 以上),KV cache 会迅速吃掉剩余显存,需要限制并发或使用 KV 量化。

做不了的:任何 30B 级以上模型的全量微调;70B 级模型的常规推理(除非激进量化并接受质量损失);大批次高分辨率扩散模型训练。

值得强调的是,24G 卡的性价比优势非常大:小时价只有高端卡的十分之一到五分之一,而大多数个人开发者和中小团队的实际任务——跑通流程、微调小模型、批量推理——都落在它的能力范围内。把任务硬塞进 24G 并优化批次,往往比直接租 80G 更省钱。

分水岭二:40G 与 48G 的中间地带

40G 档位主要由 A100 40G 与部分专业卡构成,48G 档位则是部分新卡的配置。这个档位的价值在于它刚好覆盖了 24G 到 80G 之间的空白:13B 级模型的全量微调、30B 级模型的量化推理与 LoRA 微调、以及需要较大批次的视觉任务,都在这个区间里找到合适的位置。

从价格上看,A100 40G 的时租约 2.4-2.9 元,相比 4090 的 1.2-2.5 元贵不了太多,但显存多出近一倍,还带来更好的企业级稳定性与互联能力。对于”24G 不够、80G 太贵”的任务,40G 档位经常是最优解。

需要区分同一型号内的容量差异:A100 有 40G 和 80G 两个版本,除了容量,显存带宽也不同,80G 版本带宽更高,对带宽敏感的大模型推理与训练影响明显。所以预算允许时,同一型号优先选大显存版本,带宽通常同步提升。

分水岭三:什么时候必须上 80G 及以上

80G 档位是 H100、H800 的主场,国内时租约 9.6-12 元。触发这个档位的场景有三类。

第一类是模型规模硬性超出。70B 级模型即使 4-bit 量化后仍需要 35-40GB 权重空间,加上 KV cache 和框架开销,40G 卡会非常紧张甚至不可用,80G 是能稳定运行的最低门槛。如果要做 70B 的全量微调,单卡无论多大都不够,必须进入多卡并行的领域。

第二类是对显存带宽敏感的场景。大模型推理的瓶颈经常不在算力而在带宽——每生成一个 token 都要把权重从显存读一遍,带宽直接决定吞吐。H100 的显存带宽远高于消费级卡,这就是它在推理场景下比同算力消费卡更快的原因。”保显存带宽”这个思路在国产 H20 的设计上体现得更极端:保留了高显存带宽,但大幅削减了算力,专为推理与显存容量敏感场景设计。

第三类是多卡训练。当模型要切分到多张卡上时,卡间互联(NVLink)的带宽成为关键。多卡训练不是简单地把卡堆在一起,互联带宽不足会让通信时间吃掉算力收益。这也是 H100 与 H800 的核心差异所在:H800 作为合规版本把 NVLink 带宽从 900GB/s 调整到 600GB/s,单卡算力相近,但大规模多卡训练的扩展效率会受影响。

显存不够时的补救清单

在掏钱升级显卡之前,先按下面的顺序排查,很多 OOM 并不需要换卡就能解决。

  • 降低批大小并开启梯度累积。把批大小从 8 降到 2,显存占用大幅下降,再用梯度累积把等效批大小补回来。代价是训练变慢,但结果基本等价。
  • 开启梯度检查点。用重算换显存,前向传播的中间结果不再全部保留,显存占用可显著降低,代价是训练速度下降一到三成。
  • 改用 LoRA 或其他参数高效微调。如果任务是微调而非从头训练,LoRA 能让 24G 卡完成原本需要 80G 卡的工作,这是性价比最高的一招。
  • 量化权重。INT8 大约把权重减半,4-bit 大约减到四分之一,推理场景下这是最直接的手段。代价是精度损失,需要用自己的评测集验证。
  • 量化 KV cache。长上下文场景下 KV cache 是隐形杀手,把它量化能在几乎不影响质量的前提下把上下文长度翻倍。
  • 使用 CPU 卸载或分层加载。把暂时不用的层放在内存里,需要时再换入,能跑起来但速度损失明显,适合验证与调试而非生产。

按场景选卡对照表

你的任务 建议显存 可选卡型 备注
7B-13B 模型推理服务 24G 4090 / 4090D / 3090 量化后并发能力更强,成本最低
7B 模型 LoRA 微调 24G 4090 / 3090 配合梯度检查点,性价比最优
AIGC 出图与短视频生成 24G 4090 / 5090 5090 显存与带宽更高,单价 2.68-3.28 元
13B 模型全量微调 40-48G A100 40G 时租约 2.4-2.9 元,性价比档位
30B 模型推理与 LoRA 40-80G A100 80G / 昇腾 910B 64G 910B 提供 64G 显存,适合信创场景
70B 模型推理 80G H100 / H800 / H20 需量化,注意上下文与并发预算
70B 级多卡训练 多卡 80G H100 / H800 集群 关注 NVLink 带宽与扩展效率

常见问题

显存和算力,预算有限时先保哪个?

先保显存。算力不足只影响速度,显存不足直接导致任务无法运行。在同一个价格区间里,如果一张卡算力高但显存小,另一张算力略低但显存大一档,优先选显存大的那张——尤其是涉及模型规模、批次或长上下文的任务。只有在任务显存需求已经明确满足后,才轮到用算力去换时间。

为什么我的模型在 24G 上能推理,一训练就爆显存?

因为训练要比推理多存三样东西:激活值、梯度和优化器状态。推理只需要权重加 KV cache,训练还要为反向传播保留中间结果,Adam 类优化器还会为每个参数额外保存动量。三者叠加,训练显存需求经常是推理的数倍。解决办法是改用 LoRA 只训练少量新增参数,或者开启梯度检查点、减小批大小。

量化的精度损失能接受吗?

大多数场景下可以,前提是你用自己的评测集验证过。经验上 4-bit 量化在通用对话与检索类任务上的质量损失通常可控,但在需要精确数值推理、代码生成或长链推理的任务上,损失会更容易被察觉。建议的做法是:先在量化模型上跑一遍你的真实任务集,对比几个关键指标,再决定是否上线。

多卡能解决显存不够的问题吗?

能,但代价比想象中大。多卡方案需要模型并行或张量并行,卡间通信开销会拉低扩展效率,而且对互联带宽有要求。在小规模场景下,租一张大显存卡通常比租多张小显存卡更省心也更省钱;只有当单卡显存上限(目前 80G 级)确实装不下模型时,多卡才是必选项。

昇腾 910B 的 64G 显存在哪个档位?

介于 40G 与 80G 之间,接近 80G 档位的能力下限。910B 提供 64G 显存与 1.6TB/s 带宽,FP16 算力约 280 TFLOPS,对位的是 H20 一类的推理优化型卡。它适合有信创合规要求、或希望为供应链风险做对冲的团队;代价是需要经历 CUDA 到 CANN 生态的迁移适配期。

避坑清单

  • 只看参数量估显存。权重只是四部分之一,遗漏激活值、优化器状态与 KV cache 是 OOM 的头号原因。
  • 忽略批次与上下文的影响。同一个模型批大小和序列长度一变,显存需求可能差出几倍,评估必须按真实配置来。
  • 把 24G 当成万能卡。它性价比很高但有明确边界,30B 以上的全量微调不要指望它。
  • 跳过 40G 直接上 80G。很多任务在 40G 档位就能舒适运行,跳过中间档等于白付溢价。
  • 不做量化验证就上线。量化确实省显存,但精度损失要在自己的任务上验证,不能只看论文数字。

按画像给建议

  • 个人开发者:从 24G 起步,用 4090 或 4090D 把 7B 到 13B 的推理和 LoRA 微调跑通。只有当明确撞上显存墙时,才考虑升到 40G 档。像 AutoDL 这类零售向平台提供了丰富的 24G 卡型,适合按小时试错。
  • 中小团队:把 24G 作为开发与推理的主力,40G 档作为微调与中等模型的补充,80G 留给真正的刚需场景。建议按任务类型给不同卡型设定默认值,避免所有人都默认申请最贵的卡。
  • 企业与研究机构:先按模型的显存需求曲线做容量规划,再叠加合规与稳定性要求。涉及 70B 级模型或多卡训练时,把互联带宽与扩展效率纳入评估;有信创要求时,可同步评估 64G 显存的国产方案。

回到最初那句话:显存决定跑不跑得起来,算力决定跑得多快。把这句话当作选卡的第一原则,配合上面的档位表与补救清单,你就能用最小的成本把任务放进合适的卡里,而不是在 OOM 与账单之间反复摇摆。所有价格与规格请以平台官网实时披露为准,本指南提供的区间仅用于建立量级感。

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *