Category: GPU 选型

  • 显存怎么选:24G、40G、48G、80G 的分水岭

    先说结论:显存是选卡的第一硬指标

    在选 GPU 这件事上,算力(TFLOPS)决定”跑得多快”,显存(VRAM)决定”跑不跑得起来”。两者优先级完全不同:算力不够,你把批次调小、训练时间拉长,任务最终还能完成;显存不够,模型在加载权重的那一刻就直接报 out of memory。所以在预算允许的范围内,选卡的正确顺序是”先看显存够不够,再看算力划不划算,最后看价格和平台”。

    2026 年国内市场上,24G 的 RTX 4090 时租约 1.2-2.5 元,40G 的 A100 约 2.4-2.9 元,80G 的 H100/H800 国内约 9.6-12 元,国产昇腾 910B 提供 64G 显存。价格随容量阶跃式上升,但并非所有任务都要爬到阶梯顶端。这篇文章要解决的,就是帮你判断自己的模型落在哪一个档位,以及显存不够时除了加钱换卡还有哪些补救手段。

    一句话版本:7B 级模型做推理,24G 通常够用;13B 到 30B 级模型微调,40G 或 48G 是舒适区;70B 级模型不量化就很难在单卡上跑,80G 只是起点而不是终点。

    显存到底被什么占用

    很多人以为显存只用来放模型权重,这是最常见的误解。实际上一张卡上的显存被至少四部分同时占用,任何一部分失控都会导致 OOM。

    第一部分是模型权重。参数量乘以每个参数的字节数就是权重体积:FP16 精度下每个参数占 2 字节,所以 7B 模型约 14GB,13B 约 26GB,70B 约 140GB。这是最容易被估算的一部分,也是唯一可以靠量化显著压缩的一部分。

    第二部分是激活值与梯度。训练时前向传播的中间结果必须保留到反向传播使用,批大小(batch size)和序列长度(sequence length)直接决定这部分的开销。同样一个模型,批大小从 1 调到 8,激活值可能翻好几倍。这也是为什么”这个模型我用 24G 能推理但训练就爆显存”——推理只需要权重加 KV cache,训练还要额外装下梯度和优化器状态。

    第三部分是优化器状态。以 Adam 系列优化器为例,它要为每个参数额外保存一阶和二阶动量,全量微调下这部分开销往往是权重本身的数倍。这就是 LoRA 这类参数高效微调方法存在的根本原因:它只训练极少量新增参数,把优化器状态的开销压到几乎可以忽略,从而让 24G 卡也能微调 7B 级模型。

    第四部分是推理场景下的 KV cache。自回归生成时每个已生成的 token 都要缓存注意力键值对,上下文越长、并发越高,这部分占用越大,长上下文场景下甚至可能超过权重本身。明白这四部分,你就知道显存需求不是”模型有多大”一个变量,而是”模型规模 × 精度 × 批次 × 上下文长度”的乘积。

    占用来源 大致与什么成正比 训练时 推理时 主要压缩手段
    模型权重 参数量 × 每参数字节 必须 必须 INT8 / 4-bit 量化
    激活值 批大小 × 序列长度 × 层宽 必须 很小 梯度检查点、减小批次
    优化器状态 参数量 × 倍数 全量微调必须 不需要 LoRA / 冻结底座
    KV cache 层数 × 头数 × 上下文 × 并发 需要 对话类负载显著 量化 KV、限制上下文

    量级表:不同规模模型要多少显存

    下面这张表给出的是”量级区间”,用来说明档位关系,不是精确值。实际占用会随框架实现、精度、批次与序列长度浮动,参考时请按自己的配置留出余量。

    模型规模 FP16 权重 4-bit 量化权重 推理起步显存 全量微调显存 LoRA 微调显存
    7B 级 约 14GB 约 4-5GB 16-24G 档 需要 80G 档或多卡 24G 档可尝试
    13B 级 约 26GB 约 7-9GB 24-40G 档 需要 80G 档起步 40G 档较舒适
    30B 级 约 60GB 约 16-20GB 40-80G 档 需要多卡 40-80G 档
    70B 级 约 140GB 约 35-40GB 需量化后 80G 档 需要多卡集群 80G 档起步

    读这张表的正确方式是看”档位跳变”而不是记具体数字。7B 级模型是 24G 卡的上限区间,量化之后 24G 可以宽松地跑推理;13B 级模型量化后能在 24G 上跑,但会比较紧,40G 会明显从容;30B 级以上开始进入 40G 到 80G 的讨论范围;70B 级模型即使 4-bit 量化后权重也需要 35-40GB,单张 80G 能装下权重,但留给 KV cache 和激活值的空间并不宽裕,这直接决定了它的并发能力和上下文长度都受限。这就是”80G 只是起点”的含义。

    分水岭一:24G 能干什么、不能干什么

    24G 是当前国内供给最充足、价格最亲民的显存档位,RTX 4090、4090D、3090 都是 24G。它的能力边界相当清晰。

    能做的:7B 到 13B 级模型的推理服务;7B 级模型的 LoRA 微调;AIGC 出图(Stable Diffusion 系列)与视频生成的轻量场景;中小规模的传统视觉模型训练;嵌入模型、重排序模型的批量推理。

    勉强的:13B 级模型的 LoRA 微调,需要把批大小压到很小并开启梯度检查点,训练速度会明显变慢;长上下文推理(比如 32K 以上),KV cache 会迅速吃掉剩余显存,需要限制并发或使用 KV 量化。

    做不了的:任何 30B 级以上模型的全量微调;70B 级模型的常规推理(除非激进量化并接受质量损失);大批次高分辨率扩散模型训练。

    值得强调的是,24G 卡的性价比优势非常大:小时价只有高端卡的十分之一到五分之一,而大多数个人开发者和中小团队的实际任务——跑通流程、微调小模型、批量推理——都落在它的能力范围内。把任务硬塞进 24G 并优化批次,往往比直接租 80G 更省钱。

    分水岭二:40G 与 48G 的中间地带

    40G 档位主要由 A100 40G 与部分专业卡构成,48G 档位则是部分新卡的配置。这个档位的价值在于它刚好覆盖了 24G 到 80G 之间的空白:13B 级模型的全量微调、30B 级模型的量化推理与 LoRA 微调、以及需要较大批次的视觉任务,都在这个区间里找到合适的位置。

    从价格上看,A100 40G 的时租约 2.4-2.9 元,相比 4090 的 1.2-2.5 元贵不了太多,但显存多出近一倍,还带来更好的企业级稳定性与互联能力。对于”24G 不够、80G 太贵”的任务,40G 档位经常是最优解。

    需要区分同一型号内的容量差异:A100 有 40G 和 80G 两个版本,除了容量,显存带宽也不同,80G 版本带宽更高,对带宽敏感的大模型推理与训练影响明显。所以预算允许时,同一型号优先选大显存版本,带宽通常同步提升。

    分水岭三:什么时候必须上 80G 及以上

    80G 档位是 H100、H800 的主场,国内时租约 9.6-12 元。触发这个档位的场景有三类。

    第一类是模型规模硬性超出。70B 级模型即使 4-bit 量化后仍需要 35-40GB 权重空间,加上 KV cache 和框架开销,40G 卡会非常紧张甚至不可用,80G 是能稳定运行的最低门槛。如果要做 70B 的全量微调,单卡无论多大都不够,必须进入多卡并行的领域。

    第二类是对显存带宽敏感的场景。大模型推理的瓶颈经常不在算力而在带宽——每生成一个 token 都要把权重从显存读一遍,带宽直接决定吞吐。H100 的显存带宽远高于消费级卡,这就是它在推理场景下比同算力消费卡更快的原因。”保显存带宽”这个思路在国产 H20 的设计上体现得更极端:保留了高显存带宽,但大幅削减了算力,专为推理与显存容量敏感场景设计。

    第三类是多卡训练。当模型要切分到多张卡上时,卡间互联(NVLink)的带宽成为关键。多卡训练不是简单地把卡堆在一起,互联带宽不足会让通信时间吃掉算力收益。这也是 H100 与 H800 的核心差异所在:H800 作为合规版本把 NVLink 带宽从 900GB/s 调整到 600GB/s,单卡算力相近,但大规模多卡训练的扩展效率会受影响。

    显存不够时的补救清单

    在掏钱升级显卡之前,先按下面的顺序排查,很多 OOM 并不需要换卡就能解决。

    • 降低批大小并开启梯度累积。把批大小从 8 降到 2,显存占用大幅下降,再用梯度累积把等效批大小补回来。代价是训练变慢,但结果基本等价。
    • 开启梯度检查点。用重算换显存,前向传播的中间结果不再全部保留,显存占用可显著降低,代价是训练速度下降一到三成。
    • 改用 LoRA 或其他参数高效微调。如果任务是微调而非从头训练,LoRA 能让 24G 卡完成原本需要 80G 卡的工作,这是性价比最高的一招。
    • 量化权重。INT8 大约把权重减半,4-bit 大约减到四分之一,推理场景下这是最直接的手段。代价是精度损失,需要用自己的评测集验证。
    • 量化 KV cache。长上下文场景下 KV cache 是隐形杀手,把它量化能在几乎不影响质量的前提下把上下文长度翻倍。
    • 使用 CPU 卸载或分层加载。把暂时不用的层放在内存里,需要时再换入,能跑起来但速度损失明显,适合验证与调试而非生产。

    按场景选卡对照表

    你的任务 建议显存 可选卡型 备注
    7B-13B 模型推理服务 24G 4090 / 4090D / 3090 量化后并发能力更强,成本最低
    7B 模型 LoRA 微调 24G 4090 / 3090 配合梯度检查点,性价比最优
    AIGC 出图与短视频生成 24G 4090 / 5090 5090 显存与带宽更高,单价 2.68-3.28 元
    13B 模型全量微调 40-48G A100 40G 时租约 2.4-2.9 元,性价比档位
    30B 模型推理与 LoRA 40-80G A100 80G / 昇腾 910B 64G 910B 提供 64G 显存,适合信创场景
    70B 模型推理 80G H100 / H800 / H20 需量化,注意上下文与并发预算
    70B 级多卡训练 多卡 80G H100 / H800 集群 关注 NVLink 带宽与扩展效率

    常见问题

    显存和算力,预算有限时先保哪个?

    先保显存。算力不足只影响速度,显存不足直接导致任务无法运行。在同一个价格区间里,如果一张卡算力高但显存小,另一张算力略低但显存大一档,优先选显存大的那张——尤其是涉及模型规模、批次或长上下文的任务。只有在任务显存需求已经明确满足后,才轮到用算力去换时间。

    为什么我的模型在 24G 上能推理,一训练就爆显存?

    因为训练要比推理多存三样东西:激活值、梯度和优化器状态。推理只需要权重加 KV cache,训练还要为反向传播保留中间结果,Adam 类优化器还会为每个参数额外保存动量。三者叠加,训练显存需求经常是推理的数倍。解决办法是改用 LoRA 只训练少量新增参数,或者开启梯度检查点、减小批大小。

    量化的精度损失能接受吗?

    大多数场景下可以,前提是你用自己的评测集验证过。经验上 4-bit 量化在通用对话与检索类任务上的质量损失通常可控,但在需要精确数值推理、代码生成或长链推理的任务上,损失会更容易被察觉。建议的做法是:先在量化模型上跑一遍你的真实任务集,对比几个关键指标,再决定是否上线。

    多卡能解决显存不够的问题吗?

    能,但代价比想象中大。多卡方案需要模型并行或张量并行,卡间通信开销会拉低扩展效率,而且对互联带宽有要求。在小规模场景下,租一张大显存卡通常比租多张小显存卡更省心也更省钱;只有当单卡显存上限(目前 80G 级)确实装不下模型时,多卡才是必选项。

    昇腾 910B 的 64G 显存在哪个档位?

    介于 40G 与 80G 之间,接近 80G 档位的能力下限。910B 提供 64G 显存与 1.6TB/s 带宽,FP16 算力约 280 TFLOPS,对位的是 H20 一类的推理优化型卡。它适合有信创合规要求、或希望为供应链风险做对冲的团队;代价是需要经历 CUDA 到 CANN 生态的迁移适配期。

    避坑清单

    • 只看参数量估显存。权重只是四部分之一,遗漏激活值、优化器状态与 KV cache 是 OOM 的头号原因。
    • 忽略批次与上下文的影响。同一个模型批大小和序列长度一变,显存需求可能差出几倍,评估必须按真实配置来。
    • 把 24G 当成万能卡。它性价比很高但有明确边界,30B 以上的全量微调不要指望它。
    • 跳过 40G 直接上 80G。很多任务在 40G 档位就能舒适运行,跳过中间档等于白付溢价。
    • 不做量化验证就上线。量化确实省显存,但精度损失要在自己的任务上验证,不能只看论文数字。

    按画像给建议

    • 个人开发者:从 24G 起步,用 4090 或 4090D 把 7B 到 13B 的推理和 LoRA 微调跑通。只有当明确撞上显存墙时,才考虑升到 40G 档。像 AutoDL 这类零售向平台提供了丰富的 24G 卡型,适合按小时试错。
    • 中小团队:把 24G 作为开发与推理的主力,40G 档作为微调与中等模型的补充,80G 留给真正的刚需场景。建议按任务类型给不同卡型设定默认值,避免所有人都默认申请最贵的卡。
    • 企业与研究机构:先按模型的显存需求曲线做容量规划,再叠加合规与稳定性要求。涉及 70B 级模型或多卡训练时,把互联带宽与扩展效率纳入评估;有信创要求时,可同步评估 64G 显存的国产方案。

    回到最初那句话:显存决定跑不跑得起来,算力决定跑得多快。把这句话当作选卡的第一原则,配合上面的档位表与补救清单,你就能用最小的成本把任务放进合适的卡里,而不是在 OOM 与账单之间反复摇摆。所有价格与规格请以平台官网实时披露为准,本指南提供的区间仅用于建立量级感。

  • RTX 4090 云租用性价比指南:1.2-2.5 元/小时怎么花得值

    结论先行:4090 是性价比的锚点

    2026 年在国内云上租 GPU,RTX 4090 是最值得作为”锚点”的一张卡:24G 显存、消费级旗舰的算力、供给最充足、价格最透明,市场价约 1.2-2.5 元/小时,包月折算可以低到 0.8-1.5 元/小时。它既不是最便宜的,也不是最强的,但它处在”够用”与”划算”的交点上——绝大多数个人开发者和中小团队的日常任务,用 4090 就能跑完,而成本只有 A100 的一半左右、H100 的七分之一左右。

    这篇文章回答一个具体问题:1.2-2.5 元/小时这个价格带里,怎么花钱才值。答案是三件事——选对场景、看清价格口径、避开配套性能的坑。24G 显存能干什么、不能干什么,比卡上标的算力数字重要得多。

    价格带:同一张卡,为什么差了近一倍

    先把价格拆开看。4090 的价格差异主要来自四个变量:是否包月、卡池新旧与机房地域、计费粒度(按秒还是按小时取整)、以及渠道折扣(新用户券、会员价)。把公开市场报价按口径整理成表,就能看出差异的来源。

    口径 价格区间 说明
    按需时租(零售平台) 1.2-2.5 元/小时 算家云约 1.24 元、智星云约 1.31 元、AutoDL 约 1.8-2.5 元
    包月折算 0.8-1.5 元/小时 月均使用越长越划算,通常是省 20-30% 的量级
    老一代同级卡(3090) 约 1 元/小时起 显存同为 24G,算力弱于 4090,适合显存敏感场景
    降配版 4090D 约 1.14 元/小时起 价格略低,算力有折损
    新一代 5090 2.68-3.28 元/小时 32G 显存,显存与带宽提升,单价约为 4090 的两倍
    入门卡(3080Ti/2080Ti 等) 0.88-0.98 元/小时 预算极紧时的试水选择

    读这张表的正确方式不是找”最便宜的 1.2″,而是确认三件事:你的任务时长是否达到包月门槛、你的机房是否在数据附近(影响传输与延迟)、以及计费粒度是否对你有利。一个按秒计费、1.6 元/小时的平台,对”每次只跑几十分钟”的任务,往往比按小时取整、1.24 元/小时的平台更省钱。

    24G 显存能干什么

    4090 的 24G 显存是它的核心资产,也是它的天花板。显存决定了三件事:能装多大的模型、能设多大的批次、能支持多长的上下文。以公开的模型规模经验为参考,7B 级模型在推理时占用约 14-16G(FP16 口径),经过 4-bit 量化后可以压缩到约 5-6G;13B 级模型 FP16 推理约需 26G 以上,必须量化后才能装进 24G;70B 级模型即便量化后也超出单张 24G 的容量,需要多卡或更大显存的卡。这意味着 4090 的能力边界大致落在”7B-13B 模型 + 参数高效微调”这一带。

    需要补充的是,显存占用不是只看模型权重的静态值。训练时的优化器状态、梯度、激活值都会占用额外显存,批次越大、序列越长,激活占用越高;推理时的 KV 缓存也会随上下文长度增长。因此同一个模型,在不同批次与序列长度下,能否装进 24G 的答案可能完全不同。这也是为什么”这张卡能不能跑”这个问题,必须用你自己的任务参数去验证,而不是照搬别人给出的结论。

    适合 4090 的四类场景

    一、AIGC 出图与视频生成

    出图类负载对显存敏感、对多卡互联不敏感,24G 显存可以支撑较高分辨率的批量生成,是 4090 最典型的用武之地。这类任务通常短时、突发、可并行,配合按秒计费与包月时段,成本非常可控。注意显存占用会随分辨率与批量线性上升,出图时显存溢出(OOM)多半是批量设得太大,而不是卡不够强。

    二、LoRA 与轻量微调

    参数高效微调是 4090 的第二主场。7B 级模型做 LoRA 微调,显存占用通常可以压在 24G 以内;13B 级则需要更激进的梯度检查点与量化组合。这里的经验是:微调的成本主要不是卡价,而是”试错次数”——一次超参没调好就要重来,所以计费粒度细、开机快的平台,实际比单价低但开机慢的平台更省。

    三、中小模型训练与算法验证

    图像分类、检测、分割、语音、时序预测这类中小规模模型的训练,4090 完全够用。多卡场景下要注意,消费级卡之间的互联能力弱于数据中心卡,数据并行(DP)通常比张量并行(TP)更现实:前者通信量小,后者对卡间带宽要求高,在 4090 集群上很难获得线性加速。

    四、在线推理与小规模服务

    如果用 vLLM 这类推理框架做 7B-13B 的在线服务,单张 4090 可以达到可观的并发。代价是消费级卡在长时间高负载下的稳定性不如数据中心卡,生产环境建议至少保留冗余实例,并明确评估平台是否提供故障赔付条款。

    什么时候该从 4090 升级到 A100

    4090 的边界非常清楚:显存需求超过 24G 时,它就不再是选项。判断是否需要升级,可以用三个信号来识别。

    第一个信号是”反复为了省显存而妥协”。当你不得不降低批次、缩短序列长度、或者改用更激进的量化才能跑起来,而这些妥协已经影响到效果或吞吐时,说明瓶颈是显存而不是成本,升级到 40G/80G 的卡是正确方向。第二个信号是”稳定性成为生产要求”。消费级卡在长时间高负载下的表现不如数据中心卡,如果任务需要 7×24 运行并附带赔付条款,数据中心卡的溢价是买保险。

    第三个信号是”多卡并行的扩展效率不达标”。如果业务已经需要多张卡协同,而消费级卡之间缺乏高带宽互联导致扩展效率明显偏低,那么换成有高带宽互联的数据中心卡,可能比继续加卡更省钱——多买两张 4090 的钱,往往已经接近一张 A100 的时租成本。

    反过来,如果以上三个信号都没出现,升级就是不划算的。A100 的时租在 2.4-2.9 元区间,是 4090 的两倍左右,仅因为”听起来更强”而升级,等于为用不上的能力付费。

    配套性能陷阱:卡之外的三个瓶颈

    4090 的算力很少是瓶颈,真正拖慢任务的是卡之外的三件事,这也是评测平台时最容易忽略的部分。

    • 磁盘 IO。训练任务启动时要读取数据集,如果磁盘吞吐低,GPU 会大量时间处于等待状态。判断方法是在试用阶段实测读取大文件的速度,而不是只看卡型。
    • 网络带宽。拉取镜像、上传数据集、下载模型权重都走网络。出网带宽受限或按流量计费时,”便宜的卡”可能被昂贵的流量费吃掉优势。
    • 虚拟化损耗。云上实例通常是虚拟化或容器化的,实测算力可能低于物理卡;不同平台的损耗比例不同,建议用固定基准脚本对比,而不是相信标称参数。

    还有一个常被忽略的点是存储计费:数据盘、快照、镜像往往与卡时分开计费,长期保留数据的成本会随时间累积。把任务设计成”用完即清”,比单纯找低价卡更有效。

    把这三点连起来,就得到一条实际的决策路径:先用一次真实负载确认显存与吞吐是否满足需求,再确认价格口径(包月还是按需、按秒还是按小时计费),最后确认磁盘性能、网络成本与故障赔付条款。三步都通过,这台 4090 才真正”值”;只要有任何一项不通过,就要重新考虑卡型或平台选择,而不是继续在单价上做文章。

    替代关系:4090D、3090、5090 怎么选

    卡型 显存 相对 4090 的定位 什么时候选它
    RTX 4090D 24G 算力略低的替代版,价格约 1.14 元/时起 预算敏感、且任务对算力不敏感(如轻量推理、出图)
    RTX 3090 24G 老一代,算力弱、价格约 1 元/时起 显存敏感但算力需求低,或需要更低的长期成本
    RTX 5090 32G 新一代,显存与带宽提升,单价约 2.68-3.28 元/时 13B 级微调、更高分辨率出图、需要更大显存余量
    A100 40G/80G 数据中心卡,显存与稳定性更好,约 2.4-2.9 元/时 显存超过 24G 的需求、长时间生产任务

    选型逻辑可以归纳成一句话:先看显存够不够,再看算力够不够,最后看稳定性够不够。显存不够就只能换卡,算力不够可以换算法或加卡,稳定性不够则要靠平台兜底。按这个顺序判断,就不会被单价带偏。

    还有一个实用的观察角度是”单位任务成本”,而不是”单位小时成本”。同样一项出图任务,在 1.2 元/小时的老卡上跑到深夜,可能比在 2.5 元/小时的新卡上快速跑完更贵;同理,一个因为磁盘 IO 慢而多跑两小时的实例,实际成本远超标称单价所显示的数字。把成本除以任务产出(出一张图、训一轮、处理一条请求),得到的数字才真正可比。

    常见问题

    4090 和 5090 之间,差价值得吗?

    关键看你是否需要多出来的显存余量。如果任务在 24G 内就能跑得舒服,5090 的溢价(单价约两倍)性价比不高;如果经常撞到显存上限(比如 13B 级微调、高分辨率视频生成),32G 带来的”不用反复调参省显存”的体验提升,往往比多付的单价更值钱。判断标准是:过去一个月你有没有因为显存不足而降低批量或改用量化。

    包月一定比按需省吗?

    不一定。包月省 20-30% 的前提是使用时长足够长、且基本吃满。月均使用量级在 150 小时以上时,包月通常更划算;低于这个量级,按需或按秒计费更灵活。特别是任务间隔较长的开发者,包月意味着为闲置付费。

    为什么平台标称的算力我跑不出来?

    三个原因:虚拟化损耗、散热降频、以及共享资源争抢。另外,标称参数通常是理论峰值,实际负载受显存带宽、内存与磁盘 IO 制约。正确的做法是用你自己的负载做基准测试,而不是用通用跑分脚本,因为跑分与真实负载之间经常脱节。

    多张 4090 能替代一张 A100 吗?

    在显存需求不超过 24G 的前提下,某些场景可以,但要注意互联差异。消费级卡之间缺乏高带宽互联,多卡并行的扩展效率通常明显低于数据中心卡,尤其是张量并行。数据并行场景下,多张 4090 是现实可行的方案;张量并行或需要大显存的场景,还是应该选 A100 或更大显存的卡。

    怎么判断一个平台的 4090 值不值?

    用四个动作验证:跑一次真实负载测吞吐;实测磁盘读取速度;确认计费粒度与关机是否计费;读一遍故障与赔付条款。四项都过关,再考虑价格。只看单价就下单,是最常见的踩坑方式。

    总结与画像建议

    • 个人开发者:首选按需或按秒计费的 4090,把预算花在试错次数上而不是闲置时长上;出图与 LoRA 微调是它的最佳场景。
    • 小型团队:用”4090 包月基线 + 突发按需”的组合,把稳定负载包月锁定成本,把实验负载留给按需;同时保留一张 5090 或 A100 的临时额度应对显存溢出。
    • 生产服务:4090 可以做推理,但要评估长时间高负载的稳定性与赔付条款,必要时用多实例冗余替代单卡高负载。OpenBayes 这类平台可以对照其公开的卡型与计费口径做横向比较。

    回到最初的问题:1.2-2.5 元/小时怎么花得值。答案是——把 4090 用在它擅长的地方(显存需求落在 24G 以内的任务),把价格口径对齐(包月还是按需、按秒还是按小时),把配套性能测清楚(磁盘、网络、损耗)。做到这三点,你的每一小时都在为结果付费,而不是为等待付费。所有价格均为 2026 年公开市场区间的量级整理,请以各平台官网实时价格为准。

  • A100、H100、H800、H20 一张表看懂:架构、互联与价格差异

    结论先行:四张卡的定位一句话

    A100、H100、H800、H20 这四张卡经常被放在一起比较,但它们的定位其实分属三个不同的逻辑:A100 是上一代数据中心主力,显存与生态成熟;H100 是当前高端训练与推理的标杆,卡间互联带宽最高;H800 是 H100 的合规版本,互联带宽做了折损;H20 则是一条完全不同的设计路线——保留显存容量与带宽,主动削减算力。选择的核心不是”谁最快”,而是”你的瓶颈在互联、在显存,还是在算力”。

    下面用一张规格速查表把差异摆平,再逐条解释 800 系列的合规背景、H20 的产品逻辑,最后给出三类场景的选型决策和一段国产替代的对位说明。表中的价格是 2026 年公开市场区间的量级整理,以各平台官网实时价格为准。

    规格速查表:一张表看懂差异

    卡型 显存 显存带宽定位 卡间互联(NVLink) 算力定位 市场价量级
    A100 40G / 80G 上一代数据中心级 高带宽互联(A800 版本降至 400GB/s) 上一代通用训练主力 2.4-2.9 元/小时
    H100 80G 新一代高带宽 900GB/s 当前高端训练/推理标杆 国内约 9.6-12 元/小时;海外 $2.0-3.5
    H800 80G 与 H100 同级 600GB/s(合规版本) 与 H100 同档,互联折损 国内约 9.6-12 元/小时
    H20 96G 保留高显存带宽 按整机方案配置 主动削减算力 约 2.1 万元/月/卡 量级

    把这张表读成三句话:第一,显存容量从 40G 到 96G 跨越多个档位,直接决定你能装多大的模型;第二,互联带宽是 H100 与 H800 的核心差异(900GB/s 对 600GB/s),也是 A800 与 A100 的差异(600GB/s 对 400GB/s);第三,H20 走的是另一条曲线,它的显存与带宽不弱,但算力被有意收窄。这三句话基本覆盖了四张卡的全部选型逻辑。

    800 系列的合规背景

    理解 H800 与 A800 的存在,才能理解这张表。A800 与 H800 是面向特定合规要求的产品版本:在保留显存容量与大部分算力的同时,卡间互联带宽被下调——A800 的互联带宽降到 400GB/s,H800 降到 600GB/s(H100 为 900GB/s)。这不是”性能档次”的下调,而是针对特定参数的限制,目的在于约束大规模集群的并行扩展效率。

    这条限制的实际影响,取决于你的并行策略对卡间通信的依赖程度。张量并行(TP)需要频繁同步激活值与梯度,通信量大,带宽折损会直接反映为扩展效率下降;数据并行(DP)的通信量小得多,带宽差异的影响有限;而单卡推理几乎不受影响。所以国内做多卡训练时的常见建议是:如果预算允许且策略以 TP 为主,优先 H100;如果是 DP 为主或推理为主,H800 在价格相近时完全可以承担,不必为纸面带宽多付溢价。

    H20 的逻辑:保显存与带宽,砍算力

    H20 的设计思路与前三张卡都不一样。它保留了较大的显存容量和高显存带宽,但主动削减了计算能力,量级报价约 2.1 万元/月/卡。这个组合带来一个明确的能力画像:它擅长”数据搬运”而不是”数据计算”。

    什么负载符合这个画像?显存与带宽敏感、算力相对宽容的场景——比如以显存容量决定能否装下、以带宽决定吞吐的推理服务,特别是长上下文、大模型权重常驻显存的在线推理。反过来,计算密集型的预训练或大规模微调,在 H20 上会因为算力受限而显著拉长工期,性价比不成立。判断方法很简单:先确认你的任务在瓶颈剖面上属于”带宽受限”还是”算力受限”,前者可以考虑 H20,后者不应考虑。

    值得注意的是,H20 通常以整机或包月口径报价(约 2.1 万元/月/卡 量级),与按小时零售的 A100、H100 不在同一个计费维度上。做对比时必须先换成同一口径,否则容易得出错误结论。

    显存与互联:两个最容易被误判的参数

    选卡时最先被看到的往往是”算力”,但真正决定任务能不能跑、跑得快不快的,通常是显存容量、显存带宽与卡间互联这三个参数。

    显存容量是”能不能装下”的问题。模型权重、优化器状态、梯度与激活值都要占用显存,容量不足时任务直接无法启动,只能通过量化、梯度检查点或参数高效微调来压缩需求。这也是 A100 的 40G/80G 与 H100 的 80G、H20 的 96G 之间最直观的差别:它决定了可服务的模型规模上限。

    显存带宽是”跑得动多快”的问题。当模型权重需要频繁在显存与计算单元之间搬运时,带宽直接决定吞吐上限。这一点在推理场景尤为明显——H20 的设计正是围绕”保住显存带宽”展开的,它愿意为此牺牲算力,因为对很多推理负载来说,带宽才是真正的瓶颈。

    卡间互联是”能不能扩展”的问题。单卡能力再强,多卡训练的效率也取决于卡之间同步数据的快慢。H100 的 900GB/s、H800 的 600GB/s、A800 的 400GB/s 构成了一条清晰的分级,而并行策略对带宽的敏感度依次是:张量并行 > 流水线并行 > 数据并行。换句话说,只有当你的策略真的吃带宽时,高带宽互联的溢价才有意义。

    把这三个参数串起来,就得到一条实用的判断顺序:先看显存容量是否够装,再看显存带宽是否满足吞吐目标,最后看卡间互联是否匹配并行策略。算力排在这三项之后,因为算力不足通常可以通过增加卡数或优化实现来弥补,而显存与互联的短板往往无法绕过。

    选型决策:按场景对号入座

    场景 推荐 理由
    单卡推理、模型不超过 80G 显存 A100 或 H100 单卡 不涉及卡间互联,算力与显存满足即可,A100 成本优势明显
    长上下文、高并发在线推理 H100 或 H20 显存带宽决定吞吐;算力不是唯一瓶颈
    多机多卡大规模训练 H100 优先 TP 并行对互联带宽敏感,900GB/s 优势直接体现为扩展效率
    有合规约束的多卡训练 H800(或 A800) 按合规要求选择,接受互联带宽折损,优先用 DP 策略
    显存需求超过 24G 但预算有限 A100 40G/80G 单价 2.4-2.9 元/时,是显存升级的最低成本路径
    信创合规环境 昇腾 910B 见下一节,属于生态层面的替代而非规格替代

    国产替代:昇腾 910B 的对位

    谈到国产替代,最常被提及的是昇腾 910B。它的公开规格为 FP16 算力 280 TFLOPS、64G 显存、1.6TB/s 显存带宽,定位上与 A100 量级相近,在显存容量与带宽上具备对位能力。生态层面,910B 走的是 CANN/MindIE 路线,与 CUDA 生态并行而非兼容。

    因此国产替代的本质问题不是”规格够不够”,而是”迁移成本有多大”。从公开披露的信息看,CUDA 到 CANN 的适配周期通常在数月量级(业界公开提及过 3-6 个月的适配期),期间需要投入工程资源做算子适配、框架兼容与性能调优。这意味着选型决策要分两步:先确认是否存在信创或供应链安全的硬约束,如果有,就按长远规划预留适配时间;如果没有,则把 910B 作为长期对冲选项做小规模验证,而不是立刻全量替换。

    避坑清单

    • 只比算力数字。训练场景下互联带宽经常比峰值算力更能决定实际扩展效率,H100 与 H800 的差异就是例子。
    • 混淆报价口径。H20 是整机/包月口径(约 2.1 万元/月/卡 量级),H100 是时租口径(9.6-12 元/小时),直接比较数值没有意义。
    • 忽略显存带宽。当模型权重常驻显存时,带宽决定吞吐上限;H20 的设计正是围绕这一点展开的。
    • 用单卡跑分推断多卡表现。多卡性能受互联、并行策略、通信开销共同影响,单卡跑分无法预测。
    • 把国产替代当成简单换卡。生态迁移需要工程投入与验证周期,必须计入项目排期。
    • 升级前不定位瓶颈。如果瓶颈在显存容量或数据读取,换更强的算力并不会带来相应收益;先定位瓶颈,再决定升级方向。
    • 忽略整机配套。多卡训练不只取决于卡本身,网络拓扑、存储吞吐与调度软件同样决定实际可用的规模。

    最后补充一个容易被忽略的维度:软件生态与框架支持。同一张卡在不同框架、不同版本下的实际表现可能差异明显,尤其是在使用自定义算子、量化或特殊并行策略时。选型阶段如果能用自己的训练或推理脚本做一次真实验证,结论会比参考任何规格表都更可靠——规格表告诉你上限,你的脚本告诉你实际。

    此外,采购路径也会影响实际成本。同一张卡,整机采购、按卡租赁与按小时零售是三种不同的商业模式,对应的单价、承诺期与服务水平各不相同。做横向比较时,先把所有报价换算到同一个口径——比如统一折算成”每卡每小时”——再比较,否则很容易把整机月租与零售时租混为一谈,得出与事实相反的结论。

    结语:把决策链记下来

    规格数据会随产品迭代更新,但判断方法不会变。先看显存容量能不能装下、再看带宽与互联是否匹配负载特征、最后才比较算力与价格——这条顺序能帮你在任何一次硬件更新中快速定位。对于国产替代,把生态适配周期当成一个独立变量放进排期,而不是当成一次简单的换卡操作。这四张卡之间的差异,本质上不是”谁更强”,而是”谁更适合你的瓶颈”。

    常见问题

    H800 和 H100 到底该选哪个?

    看两件事:并行策略与合规要求。TP 为主的大规模训练优先 H100,因为 900GB/s 对 600GB/s 的差距会在扩展效率上放大;DP 为主或推理场景,H800 在价格相近时完全够用。如果存在明确的合规约束,选择范围就已经确定了。

    A100 是不是已经过时了?

    没有。A100 的 40G/80G 显存与 2.4-2.9 元/小时的单价,构成了”显存升级的最低成本路径”。对于不需要最新互联带宽、也不追求极限算力的训练与推理任务,A100 依然是性价比很高的选择,生态成熟度也是它的优势。

    H20 的算力被砍了,为什么还有人用?

    因为不是所有负载都被算力限制。长上下文、高并发的推理服务,瓶颈常在显存带宽与容量,H20 保留了这两项,因此在这类场景下仍然可用;而在训练场景下它的性价比确实不成立。用它之前先确认瓶颈在哪一侧。

    国产卡什么时候可以完全替代?

    这个问题没有统一答案,因为取决于你的软件栈复杂度。生态简单的推理服务迁移成本低,重依赖自定义算子与训练框架的项目迁移成本高。务实做法是分层替代:先从推理侧、从生态依赖少的服务开始验证,再逐步扩展到训练侧。

    显存和互联,哪个更重要?

    取决于任务阶段。训练阶段,互联更能决定多卡扩展效率;推理阶段,显存容量与带宽更能决定吞吐与可服务的上下文长度。先做瓶颈判断,再决定为哪一项付费。

    总结

    四张卡的选择可以压缩成一条决策链:先看显存容量是否装得下,再看卡间互联是否匹配你的并行策略,最后看算力与价格是否合理。H100 与 H800 的差异集中在互联(900GB/s 对 600GB/s)与合规定位;H20 走的是保显存带宽、砍算力的路线,适合带宽受限的推理而不适合计算密集的训练;A100 是显存升级的最低成本路径;昇腾 910B 属于生态层面的替代选项,需要预留适配周期。把这条决策链记住,任何新卡型出现时你都能快速定位它的位置。所有价格与规格均为公开信息区间的量级整理,具体以各平台与厂商官方渠道为准。