A100、H100、H800、H20 一张表看懂:架构、互联与价格差异

结论先行:四张卡的定位一句话

A100、H100、H800、H20 这四张卡经常被放在一起比较,但它们的定位其实分属三个不同的逻辑:A100 是上一代数据中心主力,显存与生态成熟;H100 是当前高端训练与推理的标杆,卡间互联带宽最高;H800 是 H100 的合规版本,互联带宽做了折损;H20 则是一条完全不同的设计路线——保留显存容量与带宽,主动削减算力。选择的核心不是”谁最快”,而是”你的瓶颈在互联、在显存,还是在算力”。

下面用一张规格速查表把差异摆平,再逐条解释 800 系列的合规背景、H20 的产品逻辑,最后给出三类场景的选型决策和一段国产替代的对位说明。表中的价格是 2026 年公开市场区间的量级整理,以各平台官网实时价格为准。

规格速查表:一张表看懂差异

卡型 显存 显存带宽定位 卡间互联(NVLink) 算力定位 市场价量级
A100 40G / 80G 上一代数据中心级 高带宽互联(A800 版本降至 400GB/s) 上一代通用训练主力 2.4-2.9 元/小时
H100 80G 新一代高带宽 900GB/s 当前高端训练/推理标杆 国内约 9.6-12 元/小时;海外 $2.0-3.5
H800 80G 与 H100 同级 600GB/s(合规版本) 与 H100 同档,互联折损 国内约 9.6-12 元/小时
H20 96G 保留高显存带宽 按整机方案配置 主动削减算力 约 2.1 万元/月/卡 量级

把这张表读成三句话:第一,显存容量从 40G 到 96G 跨越多个档位,直接决定你能装多大的模型;第二,互联带宽是 H100 与 H800 的核心差异(900GB/s 对 600GB/s),也是 A800 与 A100 的差异(600GB/s 对 400GB/s);第三,H20 走的是另一条曲线,它的显存与带宽不弱,但算力被有意收窄。这三句话基本覆盖了四张卡的全部选型逻辑。

800 系列的合规背景

理解 H800 与 A800 的存在,才能理解这张表。A800 与 H800 是面向特定合规要求的产品版本:在保留显存容量与大部分算力的同时,卡间互联带宽被下调——A800 的互联带宽降到 400GB/s,H800 降到 600GB/s(H100 为 900GB/s)。这不是”性能档次”的下调,而是针对特定参数的限制,目的在于约束大规模集群的并行扩展效率。

这条限制的实际影响,取决于你的并行策略对卡间通信的依赖程度。张量并行(TP)需要频繁同步激活值与梯度,通信量大,带宽折损会直接反映为扩展效率下降;数据并行(DP)的通信量小得多,带宽差异的影响有限;而单卡推理几乎不受影响。所以国内做多卡训练时的常见建议是:如果预算允许且策略以 TP 为主,优先 H100;如果是 DP 为主或推理为主,H800 在价格相近时完全可以承担,不必为纸面带宽多付溢价。

H20 的逻辑:保显存与带宽,砍算力

H20 的设计思路与前三张卡都不一样。它保留了较大的显存容量和高显存带宽,但主动削减了计算能力,量级报价约 2.1 万元/月/卡。这个组合带来一个明确的能力画像:它擅长”数据搬运”而不是”数据计算”。

什么负载符合这个画像?显存与带宽敏感、算力相对宽容的场景——比如以显存容量决定能否装下、以带宽决定吞吐的推理服务,特别是长上下文、大模型权重常驻显存的在线推理。反过来,计算密集型的预训练或大规模微调,在 H20 上会因为算力受限而显著拉长工期,性价比不成立。判断方法很简单:先确认你的任务在瓶颈剖面上属于”带宽受限”还是”算力受限”,前者可以考虑 H20,后者不应考虑。

值得注意的是,H20 通常以整机或包月口径报价(约 2.1 万元/月/卡 量级),与按小时零售的 A100、H100 不在同一个计费维度上。做对比时必须先换成同一口径,否则容易得出错误结论。

显存与互联:两个最容易被误判的参数

选卡时最先被看到的往往是”算力”,但真正决定任务能不能跑、跑得快不快的,通常是显存容量、显存带宽与卡间互联这三个参数。

显存容量是”能不能装下”的问题。模型权重、优化器状态、梯度与激活值都要占用显存,容量不足时任务直接无法启动,只能通过量化、梯度检查点或参数高效微调来压缩需求。这也是 A100 的 40G/80G 与 H100 的 80G、H20 的 96G 之间最直观的差别:它决定了可服务的模型规模上限。

显存带宽是”跑得动多快”的问题。当模型权重需要频繁在显存与计算单元之间搬运时,带宽直接决定吞吐上限。这一点在推理场景尤为明显——H20 的设计正是围绕”保住显存带宽”展开的,它愿意为此牺牲算力,因为对很多推理负载来说,带宽才是真正的瓶颈。

卡间互联是”能不能扩展”的问题。单卡能力再强,多卡训练的效率也取决于卡之间同步数据的快慢。H100 的 900GB/s、H800 的 600GB/s、A800 的 400GB/s 构成了一条清晰的分级,而并行策略对带宽的敏感度依次是:张量并行 > 流水线并行 > 数据并行。换句话说,只有当你的策略真的吃带宽时,高带宽互联的溢价才有意义。

把这三个参数串起来,就得到一条实用的判断顺序:先看显存容量是否够装,再看显存带宽是否满足吞吐目标,最后看卡间互联是否匹配并行策略。算力排在这三项之后,因为算力不足通常可以通过增加卡数或优化实现来弥补,而显存与互联的短板往往无法绕过。

选型决策:按场景对号入座

场景 推荐 理由
单卡推理、模型不超过 80G 显存 A100 或 H100 单卡 不涉及卡间互联,算力与显存满足即可,A100 成本优势明显
长上下文、高并发在线推理 H100 或 H20 显存带宽决定吞吐;算力不是唯一瓶颈
多机多卡大规模训练 H100 优先 TP 并行对互联带宽敏感,900GB/s 优势直接体现为扩展效率
有合规约束的多卡训练 H800(或 A800) 按合规要求选择,接受互联带宽折损,优先用 DP 策略
显存需求超过 24G 但预算有限 A100 40G/80G 单价 2.4-2.9 元/时,是显存升级的最低成本路径
信创合规环境 昇腾 910B 见下一节,属于生态层面的替代而非规格替代

国产替代:昇腾 910B 的对位

谈到国产替代,最常被提及的是昇腾 910B。它的公开规格为 FP16 算力 280 TFLOPS、64G 显存、1.6TB/s 显存带宽,定位上与 A100 量级相近,在显存容量与带宽上具备对位能力。生态层面,910B 走的是 CANN/MindIE 路线,与 CUDA 生态并行而非兼容。

因此国产替代的本质问题不是”规格够不够”,而是”迁移成本有多大”。从公开披露的信息看,CUDA 到 CANN 的适配周期通常在数月量级(业界公开提及过 3-6 个月的适配期),期间需要投入工程资源做算子适配、框架兼容与性能调优。这意味着选型决策要分两步:先确认是否存在信创或供应链安全的硬约束,如果有,就按长远规划预留适配时间;如果没有,则把 910B 作为长期对冲选项做小规模验证,而不是立刻全量替换。

避坑清单

  • 只比算力数字。训练场景下互联带宽经常比峰值算力更能决定实际扩展效率,H100 与 H800 的差异就是例子。
  • 混淆报价口径。H20 是整机/包月口径(约 2.1 万元/月/卡 量级),H100 是时租口径(9.6-12 元/小时),直接比较数值没有意义。
  • 忽略显存带宽。当模型权重常驻显存时,带宽决定吞吐上限;H20 的设计正是围绕这一点展开的。
  • 用单卡跑分推断多卡表现。多卡性能受互联、并行策略、通信开销共同影响,单卡跑分无法预测。
  • 把国产替代当成简单换卡。生态迁移需要工程投入与验证周期,必须计入项目排期。
  • 升级前不定位瓶颈。如果瓶颈在显存容量或数据读取,换更强的算力并不会带来相应收益;先定位瓶颈,再决定升级方向。
  • 忽略整机配套。多卡训练不只取决于卡本身,网络拓扑、存储吞吐与调度软件同样决定实际可用的规模。

最后补充一个容易被忽略的维度:软件生态与框架支持。同一张卡在不同框架、不同版本下的实际表现可能差异明显,尤其是在使用自定义算子、量化或特殊并行策略时。选型阶段如果能用自己的训练或推理脚本做一次真实验证,结论会比参考任何规格表都更可靠——规格表告诉你上限,你的脚本告诉你实际。

此外,采购路径也会影响实际成本。同一张卡,整机采购、按卡租赁与按小时零售是三种不同的商业模式,对应的单价、承诺期与服务水平各不相同。做横向比较时,先把所有报价换算到同一个口径——比如统一折算成”每卡每小时”——再比较,否则很容易把整机月租与零售时租混为一谈,得出与事实相反的结论。

结语:把决策链记下来

规格数据会随产品迭代更新,但判断方法不会变。先看显存容量能不能装下、再看带宽与互联是否匹配负载特征、最后才比较算力与价格——这条顺序能帮你在任何一次硬件更新中快速定位。对于国产替代,把生态适配周期当成一个独立变量放进排期,而不是当成一次简单的换卡操作。这四张卡之间的差异,本质上不是”谁更强”,而是”谁更适合你的瓶颈”。

常见问题

H800 和 H100 到底该选哪个?

看两件事:并行策略与合规要求。TP 为主的大规模训练优先 H100,因为 900GB/s 对 600GB/s 的差距会在扩展效率上放大;DP 为主或推理场景,H800 在价格相近时完全够用。如果存在明确的合规约束,选择范围就已经确定了。

A100 是不是已经过时了?

没有。A100 的 40G/80G 显存与 2.4-2.9 元/小时的单价,构成了”显存升级的最低成本路径”。对于不需要最新互联带宽、也不追求极限算力的训练与推理任务,A100 依然是性价比很高的选择,生态成熟度也是它的优势。

H20 的算力被砍了,为什么还有人用?

因为不是所有负载都被算力限制。长上下文、高并发的推理服务,瓶颈常在显存带宽与容量,H20 保留了这两项,因此在这类场景下仍然可用;而在训练场景下它的性价比确实不成立。用它之前先确认瓶颈在哪一侧。

国产卡什么时候可以完全替代?

这个问题没有统一答案,因为取决于你的软件栈复杂度。生态简单的推理服务迁移成本低,重依赖自定义算子与训练框架的项目迁移成本高。务实做法是分层替代:先从推理侧、从生态依赖少的服务开始验证,再逐步扩展到训练侧。

显存和互联,哪个更重要?

取决于任务阶段。训练阶段,互联更能决定多卡扩展效率;推理阶段,显存容量与带宽更能决定吞吐与可服务的上下文长度。先做瓶颈判断,再决定为哪一项付费。

总结

四张卡的选择可以压缩成一条决策链:先看显存容量是否装得下,再看卡间互联是否匹配你的并行策略,最后看算力与价格是否合理。H100 与 H800 的差异集中在互联(900GB/s 对 600GB/s)与合规定位;H20 走的是保显存带宽、砍算力的路线,适合带宽受限的推理而不适合计算密集的训练;A100 是显存升级的最低成本路径;昇腾 910B 属于生态层面的替代选项,需要预留适配周期。把这条决策链记住,任何新卡型出现时你都能快速定位它的位置。所有价格与规格均为公开信息区间的量级整理,具体以各平台与厂商官方渠道为准。

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *