Category: 成本与价格

  • 训练一个大模型到底要多少钱:从 DeepSeek-V3 的 557.6 万美元说起

    结论先行:557.6 万美元是什么口径的钱

    DeepSeek-V3 常被引用的训练成本是约 557.6 万美元,这个数字的来源很具体:训练消耗约 278.8 万 GPU 小时,按每小时 2 美元的口径折算得出。作为对比,Llama 3 405B 的训练消耗约 3080 万 GPU 小时,量级差了一个数量级。把这两个数字放在一起,能得出本文最重要的一个结论:衡量训练成本的标准单位不是”多少钱”,而是”多少 GPU 小时 × 单价”。

    但这并不意味着训练一个大模型只要 557.6 万美元。这个数字对应的是”最后一次成功的正式训练”的算力账,不含数据构建、人力投入、失败实验的试错成本,也不含上线之后的推理支出。这篇文章要做的,就是把这个数字拆开,看清它包含什么、不包含什么,然后给中小团队一个可用的成本量级感,以及四条务实的降本路径。

    GPU 小时计价法:唯一可比的成本口径

    为什么用 GPU 小时而不是美元?因为美元金额受卡型、单价、租用方式影响,跨团队不可比;而 GPU 小时是任务本身的物理消耗,换一个单价就能换算成钱。它的计算方式很直接:

    训练总成本 ≈ GPU 卡数 × 训练天数 × 24 小时 × 单卡小时单价。以 DeepSeek-V3 为例,278.8 万 GPU 小时 × 2 美元/小时 ≈ 557.6 万美元。这里的 2 美元口径对应的正是 H800 一类高端卡的海外带价水平——注意,同一份算力放在国内按 9.6-12 元/小时(约 1.3-1.7 美元)的时租口径下,金额会不同,这正是”先算 GPU 小时、再套单价”的意义。

    这套算法还能解释为什么 Llama 3 405B 的 3080 万 GPU 小时会被反复提及:它代表了”用传统稠密模型路线训练一个更大参数模型”所需的算力量级。把 278.8 万与 3080 万放在一起,差距主要来自模型架构与训练效率的路线选择,而不只是硬件规模。

    对比项 DeepSeek-V3 口径 Llama 3 405B 口径
    训练算力消耗 约 278.8 万 GPU 小时 约 3080 万 GPU 小时
    折算成本(按 2 美元/时) 约 557.6 万美元 按同一单价折算约 6160 万美元量级
    成本口径 最后一次成功训练的算力账 同类口径的算力账

    557.6 万美元不含什么

    这是最容易被误读的一点。训练一个模型的真实投入,远不止那次成功训练烧掉的卡时。把完整成本拆成四块,结构会清楚得多。

    一、数据成本

    数据的采集、清洗、去重、配比与质量筛选,是长周期的人力与工程投入。高质量语料的获取本身可能涉及采购,而清洗流水线的开发与迭代需要持续投入工程师时间。这部分成本通常不体现在 GPU 小时里,但往往是决定模型效果上限的关键。

    这笔成本还有一个特点:它随着模型规模的增长而放大。模型越大,对数据量与数据质量的要求越高,清洗与筛选的规则也越复杂。很多团队在算力上做了充足预算,却在数据环节投入不足,最终得到的结果是”卡时烧掉了,效果没出来”——从成本角度看,这比算力超支更浪费。

    二、人力成本

    一个完整的大模型训练团队包含算法、工程、数据、算力调度与评测多个角色,人员规模与周期决定了这部分支出的量级。以数月到一年以上的训练周期计算,人力成本在总投入中的占比经常不低于算力成本。

    三、试错成本

    “最后一次成功训练”这个表述本身就说明问题:在此之前会有多次失败的、被中途放弃的、超参不理想的实验运行。这些实验同样消耗卡时,也需要同样的集群规模,只是不体现在最终公布的那一个数字里。把试错倍数算进去,实际算力支出通常是公布数字的数倍量级。

    试错成本对中小团队的意义尤其现实:如果一次实验要烧掉数天的多卡集群时间,团队就会本能地减少实验次数,而实验次数恰恰是模型效果的关键变量之一。这也是为什么”用便宜的中端卡多做几轮实验”经常比”用昂贵的高端卡做一轮完美实验”更有效——前者的总成本可能更低,得到的结论却更多。

    四、推理与迭代成本

    模型训练完成只是起点。上线后的推理服务是持续性支出,规模取决于用户量、上下文长度与并发;后续的版本迭代(继续预训练、微调、对齐)又是一轮算力投入。把训练成本当成一次性投入来做预算,是最常见的错误。

    中小团队的量级感

    对绝大多数团队来说,从零训练一个千亿级模型并不现实,真正需要算的是微调与中等规模训练的量级。这里给出的是基于公开经验的量级估算,具体数值会随模型规模、序列长度、批次与并行效率大幅波动,请当作判断量级的参考而非精确预算。

    任务类型 典型卡型 算力量级(参考) 成本量级(按公开时租区间)
    7B 模型 LoRA 微调 单张 4090(24G) 数小时到数十小时 数十元级
    7B 模型全参微调 多张 A100 / 4090 数十到数百 GPU 小时 数百到数千元级
    13B 模型 LoRA 微调 A100 40G 或 5090 级 数十 GPU 小时 数百元级
    13B 模型全参微调 多张 A100 80G 数百到上千 GPU 小时 数千到万元级
    70B 级继续预训练 H100/H800 多机集群 万级 GPU 小时以上 十万元级以上

    在动手算之前,先把”需要多少 GPU 小时”这个问题拆成三个输入:模型规模(决定单步计算量与显存占用)、数据规模(决定训练步数)、以及硬件效率(决定实际吞吐与理论峰值的差距)。三者相乘才能得到量级。其中最容易出偏差的是第三项——理论峰值与实际吞吐之间通常存在明显差距,受制于显存带宽、通信开销、算子效率与集群调度。把效率系数设得乐观,预算就会被严重低估;务实的做法是按公开实践中较为克制的效率水平来估,再留出余量。

    读这张表要注意两点。第一,卡型选择由显存决定:7B 级 LoRA 单张 24G 卡就能做,13B 级全参微调就必须用 40G 以上的卡。第二,成本随 GPU 小时线性放大,规模每上一个台阶,支出是数量级变化,而不是百分比变化。这也是为什么对中小团队来说,”要不要自己训练”这个问题,答案通常是”先用微调和开源模型验证需求”。

    训练之后:推理才是长期账单

    把训练成本算清楚之后,还有一个更容易被低估的部分:推理支出是持续性支出,而训练通常是一次性或阶段性的。一次 557.6 万美元量级的训练可能对应数年服务期,但如果推理的量级大,累计支出超过训练成本并不罕见。

    推理成本的结构与训练不同:它由单次请求的计算量(受模型规模、上下文长度影响)、并发水平(决定卡是否被有效利用)、以及单位卡时价格三部分决定。因此推理降本的方向也与训练不同——训练关注吞吐与扩展效率,推理更关注”每单位请求的成本”,手段包括量化、缓存复用、批处理与更高效的解码策略。同一个模型,经过推理侧优化之后,单位成本可能下降数倍,这部分收益往往比砍训练卡时更容易拿到。

    对做预算的团队来说,这意味着在立项阶段就应该把推理成本单独列一行,并估算预期的请求量级。只算训练账、把推理当成”上线后再说”,会让整个项目的投入产出判断失真。

    降本四招

    1. 混合精度:FP8 与 BF16 的取舍

    降低数值精度是训练加速最直接的手段之一。以 FP8 混合精度为例,它通过降低激活与部分运算的数值位宽来减少显存占用与计算量,从而在同等硬件上获得更高的吞吐。代价是需要处理数值稳定性问题,对算子与框架支持有要求。实际收益取决于模型结构与实现质量,方向明确但幅度因项目而异——建议在小规模上先验证收敛性,再推到全量训练。

    2. 架构选择:MoE 的稀疏性红利

    DeepSeek-V3 与 Llama 3 405B 的 GPU 小时差异,很大程度上来自架构路线。混合专家(MoE)结构通过每次激活部分参数,让总参数量与激活计算量解耦,从而在推理与训练中摊薄单位效果的计算成本。代价是训练稳定性与通信复杂度更高,工程门槛也更高。对中小团队而言,更现实的用法是直接采用已经开源、以 MoE 为卖点的模型做后训练,而不是自己从头实现。

    3. 租用弹性:把固定成本换成可变成本

    自建集群意味着为峰值需求买单,而训练任务往往有明显的阶段性:数据准备期算力闲置、集中训练期算力紧张。用弹性租用替代自购,可以把固定成本转化为随任务伸缩的可变成本。这里的关键经验是月均使用 150 小时以上的稳定负载才考虑包月,否则按需更划算;高端卡高峰期要排队,把可中断的训练安排在凌晨与周末能显著降低成本与等待。

    4. 开源模型:站在已有的 GPU 小时上

    最彻底的降本方式是少烧卡时——直接使用开源基座模型做微调或后训练,而不是从零预训练。以公开数据看,一个 70B 级继续预训练就要万级 GPU 小时以上,而 7B-13B 的微调只需数十到上千 GPU 小时,两者相差两到三个数量级。对绝大多数业务场景来说,微调开源模型已经能覆盖绝大部分需求。

    四招之间不是孤立的,组合使用效果更明显:用开源模型做基座(省掉预训练)、用混合精度与高效微调方法压缩算力需求(省掉单次训练成本)、用弹性租用匹配波动的算力需求(省掉闲置成本)。三条路径合起来,中小团队完全可以用可承受的预算完成一个可用的领域模型——这与”训练一个大模型要几百万美元”的印象并不矛盾,因为后者的口径本身就是从零预训练一个超大模型。

    常见问题

    557.6 万美元能训练出一个 GPT-4 级模型吗?

    不能这样理解。557.6 万美元是特定模型在特定口径下最后一次成功训练的算力账,对应的技术路线、数据积累与工程能力是前提条件。把它当作”训练同类模型的普遍预算”,忽略了数据、人力与试错投入,会严重低估实际门槛。

    为什么用 GPU 小时而不是直接用美元?

    因为 GPU 小时是任务的物理消耗,与卡价无关;美元金额会随卡型与租用方式变化。用 GPU 小时做单位,可以跨团队、跨时期比较训练效率;需要换算金额时,再乘以你实际能拿到的单卡小时单价即可。

    中小团队最主要的成本误区是什么?

    三个:把训练当一次性投入(忽略推理与迭代);用峰值需求配置固定资源(忽略租用的弹性);高估自己从零训练的必要性(忽略了微调开源模型的可行性)。避免这三点,预算通常会合理得多。

    自建集群和租用,哪个训练更划算?

    取决于利用率。行业经验是利用率超过 70% 才值得评估自购,因为低于这个水平时,闲置的设备折旧、电费与运维成本会超过租用溢价。训练任务波动大,通常更适合”基线自购 + 峰值租用”的混合策略。

    MoE 一定比稠密模型省吗?

    在”单位效果的计算成本”这个维度上,MoE 的稀疏性通常带来优势;但它引入了训练稳定性、通信开销与工程复杂度,不是无条件的优化。是否采用,取决于团队是否有相应的工程能力与调优经验。

    总结

    从 557.6 万美元说起,最重要的收获不是一个价格标签,而是一套算法:训练成本 = GPU 小时 × 单价,而这个 GPU 小时只覆盖最后一次成功训练。完整的投入还要摊上数据、人力、试错与推理。对中小团队来说,务实的路径是先算清自己任务的 GPU 小时量级,再决定用哪一档卡、按需还是包月,最后优先考虑微调开源模型而不是从零训练。把这三个决定做对,成本控制的大头就已经完成了。文中所有成本与规模均为公开信息的量级整理,实际以各平台与厂商官方渠道的价格与规格为准。

  • 算力租用还是显卡自购:四笔账算清楚

    结论先行:不要比价格,比利用率

    算力租用还是显卡自购,这个问题用价格永远算不清,因为两者的成本结构完全不同:租用是可变成本,用多少付多少;自购是固定成本,先付一笔钱,然后慢慢摊。把这两种成本放在一起比较,唯一的公平方式是把它们换算成”每小时的实际成本”,而这又完全取决于一个变量——利用率。

    行业里比较通行的经验是:利用率超过 70%,才值得认真评估自购;低于这个水平,闲置带来的折旧、电费与运维成本会迅速吃掉自购的价格优势。所以本文不打算先给结论,而是先把四笔账摆开:设备折旧、电费与机房、运维人力、机会成本。算完之后,再用 H100 的公开价格做一个盈亏平衡的估算,最后给出混合策略与决策表。

    第一笔账:设备折旧

    自购的第一笔支出是硬件本身。以高端训练卡为例,单卡购置价格在 2.5-3 万美元的量级,整机还要加上 CPU、内存、主板、电源、机箱与高速互联部件,实际整机价格往往是单卡价格的若干倍。这笔钱一旦付出,就进入折旧周期。

    折旧的关键认知是:算力硬件的价值衰减速度较快。新一代产品发布后,旧卡的租赁市场价会明显下移(H100 租赁价较 2024 年峰值跌约 64% 就是例子),因此自购设备的会计折旧年限与经济折旧年限经常不一致。如果按三年直线折旧来分摊,一台 3 万美元量级的设备每天的成本就接近 30 美元——注意,这是”每天”,无论你用不用。

    第二笔账:电费与机房

    这是最容易被低估的一笔。高端卡的功耗本身可观,而整机功耗还要加上 CPU、电源转换损耗与散热。真正的成本大头在散热:把卡产生的热量排出去,需要机房级的空调或液冷系统,其耗电经常与计算设备本身处于同一量级。折算下来,电费加上散热,会让”每小时运行成本”在硬件折旧之外再增加一个可观的份额。

    如果不在自有场地,还要加上机柜租金、带宽与机房的运维服务费。这几项通常按月计费,同样与利用率无关。对个人开发者来说,在办公室或家里跑一张高端卡并不现实——噪音、供电、散热都是硬约束,这意味着自购基本等同于”租一个机房位置”,只是设备所有权不同。

    还要考虑供电余量。高端卡的瞬时功耗较高,多卡整机对配电容量、线路规格与不间断电源都有要求;一旦需要改造电力环境,这笔支出会进一步抬高自建门槛。相比之下,租用平台的这部分成本被摊薄在所有用户上,这也是租用溢价的一部分来源。

    第三笔账:运维人力

    设备买回来只是开始:驱动与框架的版本管理、集群调度软件的部署、故障排查与硬件维修、备件与替换、安全补丁与网络配置,都需要人来做。大集群还需要专职的运维或平台工程角色。

    自建集群还需要考虑冗余与备件:硬件总有故障率,一块卡坏了可能让整个多卡任务中断,因此需要准备备用卡、备用电源与替换流程。这些冗余设备平时不产生收益,却必须购置与维护;而租用平台上,故障替换由平台承担,用户只需要重新调度任务。把冗余成本计入之后,自购的真实单位成本会进一步上升。

    这笔账难算的地方在于它是隐性成本:当团队规模小的时候,这些工作会摊到算法工程师身上,表面上看不出额外支出,但会真实地消耗研发时间。衡量方式可以简单地用”每月占用多少工程师工时”来估算,再按人力成本折算。很多团队在算完这笔账之后,会发现租用的溢价其实是”买了一支运维团队”。

    第四笔账:机会成本

    最容易被忽略的一笔。自购意味着把一笔现金锁定在会持续贬值的硬件上,这笔钱本可以投入到数据、人才或产品上;也意味着弹性丧失——当业务量突增时无法快速扩容,当模型方向调整时无法快速换型。反过来,自购也有好处:长期稳定的负载、对数据物理隔离有硬要求、或需要极致性能调优的场景下,独占硬件能带来确定性与可控性。

    机会成本还包括技术路线风险。如果未来两年主流卡型或互联标准发生变化,自购的集群可能面临”能用但不再高效”的处境,而租用方可以直接切换。把这一点纳入评估,很多看起来划算的自购方案会变得不那么划算。

    还有一个常被忽略的层面是资金的灵活性。把一笔钱用于购置硬件之后,它对业务的响应能力就固定下来了;而在业务早期,方向调整频繁,把钱留在手里或投向数据与人才,往往能产生更高的回报。衡量机会成本并不需要精确的计算,只需要问一个问题:这笔钱如果不买卡,还能用在哪些地方,那些地方的边际收益是否更高?如果答案不确定,租用提供的”随时收手”能力就很有价值。

    盈亏平衡:用 H100 算一次

    把四笔账简化成一个估算模型。以高端卡为例,取公开口径:单卡购置价格约 2.5-3 万美元量级,海外时租约 2-3 美元/小时。只考虑硬件折旧、暂不计电费与运维,简单的盈亏平衡点计算如下:

    年利用率 年运行小时数 按 2.5 万美元购置的硬件摊销(按 3 年) 按 2.5 美元/时租用的年支出 粗略结论
    20% 约 1752 小时 约 8333 美元/年 约 4380 美元/年 租用明显更省
    50% 约 4380 小时 约 8333 美元/年 约 10950 美元/年 接近平衡,自购略优
    70% 约 6132 小时 约 8333 美元/年 约 15330 美元/年 自购占优,但需扣电费与运维
    90% 约 7884 小时 约 8333 美元/年 约 19710 美元/年 自购优势明显

    这张表说明了两件事。第一,平衡点大致落在 40%-50% 的利用率附近——但这是”只看硬件折旧”的简化模型,把电费、散热、机柜与运维加进去之后,实际平衡点会上移到 70% 左右。第二,利用率越低,自购的劣势越明显,因为固定成本不随使用量下降。这就是”利用率超过 70% 才评估自购”这条经验的由来。

    需要提醒的是,上述模型是量级估算,用于说明结构而非给出精确结论;实际数值取决于你拿到的采购价、电价、机房成本与租用折扣,请以实际报价为准。

    哪些情况下自购是明确正确的

    虽然大多数团队更适合租用,但确实存在几类场景,自购或长期独占是更合理的选择,值得单独说明,避免把”租用更灵活”当成一条无条件的结论。

    第一类是数据物理隔离有硬要求的场景。当合规要求决定数据不能离开特定物理边界时,租用公共算力平台在合规层面可能直接不可行,此时自建或专有环境的成本是必须支付的合规成本,而不是可以优化的对象。

    第二类是长期、稳定、高负载且可预测的任务。比如常驻的推理服务,如果请求量稳定、卡长期处于高负载,那么自购的单位成本优势会随时间显现。这类任务的特征是”利用率曲线平坦”——没有明显的波峰波谷,固定成本因此可以被充分摊薄。

    第三类是需要极致性能调优的场景。独占硬件意味着可以针对具体拓扑做网络与存储调优、可以控制内核版本与调度策略、可以排除邻居干扰。对延迟极度敏感的服务,这种可控性本身就是价值,难以用价格衡量。

    反过来,判断是否属于这三类,可以问自己三个问题:数据是否必须留在本地?负载曲线是否平坦且长期高位?性能调优的收益是否已经超过运维投入?三个问题都答”是”,自购才真正成立。

    混合策略:基线自购 + 突发租用

    对多数团队来说,二元选择本身就是伪命题。更现实的做法是分层:

    • 基线负载自购或包月。把稳定、可预测、长期占用的那部分算力(比如常驻的推理服务、固定的训练流水线)配置成自购设备或长期包月,锁定单价。
    • 突发负载按需租用。把峰值、实验、临时扩容的部分交给按需实例,避免为峰值购买硬件。
    • 特殊卡型不购。只在少数项目用到的卡型(高端训练卡、超大显存卡)一律租用,不为低频需求付出购置成本。
    • 保留一键切换能力。容器化与镜像化管理,确保工作负载可以在自建与租用之间迁移,避免被单一环境锁定。

    这套组合的核心思想是:让固定成本只覆盖确定的部分,把所有不确定性交给可变成本承担。它同时解决了成本与弹性两个问题。

    决策表

    你的情况 建议 理由
    利用率长期低于 40% 租用 固定成本无法摊薄,闲置成本高于租用溢价
    利用率约 50%-70% 租用为主,评估包月 包月可省 20-30%,且保留了弹性
    利用率稳定高于 70%,负载可预测 评估自购 固定成本被充分摊薄,长期单位成本可能更低
    负载波动大、峰值高 混合:基线自购/包月 + 峰值租用 避免为峰值购置硬件,同时锁定基线成本
    数据必须物理隔离 自购或专有环境 合规与安全要求优先于成本考量
    个人开发者或小团队 租用 缺少机房、供电与运维条件,隐性成本极高
    需要频繁试新卡型 租用 避免技术路线变化带来的资产风险

    避坑清单

    • 只算硬件钱。电费、散热、机柜、带宽与运维经常被漏掉,这几项能把单位成本抬高一个可观的幅度。
    • 用峰值需求决定采购规模。按峰值买设备,等于全年为闲置付费;按基线买、峰值租,才是更合理的结构。
    • 忽略经济折旧。新卡发布后旧卡租赁价快速下移,会计折旧年限不等于真实贬值速度。
    • 把运维当成”顺手做掉”。驱动、调度、故障、备件都会持续消耗工程师时间,隐性但真实。
    • 不做退出规划。自购设备的处置、迁移与兼容性要在采购时就考虑,否则退出成本会很高。

    常见问题

    利用率怎么算?

    用卡的实际占用时长除以可用时长。实际占用包括训练、推理与数据处理,但不包括排队、空闲与调试中断。行业经验是利用率超过 70% 才值得认真评估自购,低于这个水平,租用的弹性优势通常更划算。建议连续统计一个月以上的数据再下结论,避免被短期峰值误导。

    自购能省钱吗?

    在利用率足够高、负载足够稳定的前提下,长期单位成本可能低于租用。但省下的钱要以占用现金、承担技术路线风险、以及自建运维能力为代价。判断的关键是:你是否有稳定的高利用率,以及是否具备运维团队或愿意投入相应人力。

    小团队适合自购吗?

    通常不适合。小团队缺少机房、供电、散热与运维条件,这些隐性成本会迅速抵消硬件上的价格优势;同时业务方向可能快速调整,硬件资产的灵活性损失代价更高。更现实的选择是租用,把资本留给数据与人才。

    混合策略会不会更复杂?

    会增加一定的环境管理成本,但可以通过容器化与统一的镜像管理把复杂度控制在可接受范围内。相比”为峰值买单”或”完全受制于单一平台”,混合策略的复杂度支出通常是值得的。关键是保持工作负载的可迁移性。

    多长时间能回本?

    取决于利用率、购置价与实际时租。以高端卡 2.5-3 万美元的购置量级与 2-3 美元/小时的时租口径粗略推算,在接近满负荷运行的假设下,回本周期大致在一年多的量级;利用率减半,回本周期就会显著拉长,甚至永远无法回本。这个估算只用于说明量级,实际请以你拿到的报价为准。

    总结

    算力租用还是显卡自购,答案不在价格表里,而在你的利用率曲线上。四笔账——设备折旧、电费与机房、运维人力、机会成本——共同决定了自购的真实单位成本;把它们全部摊开后,平衡点通常落在 70% 左右的利用率。低于这条线,租用更划算且更灵活;高于这条线且负载稳定,可以认真评估自购;而绝大多数团队的最优解,是”基线自购或包月 + 突发按需租用”的混合结构。所有价格与成本均为公开信息的量级整理,请以实际报价与合同条款为准。

  • H100 租用价格全景:国内时租 9.58 元起是怎么来的

    结论先行:9.58 元这个数字是怎么构成的

    2026 年问”H100 租一小时多少钱”,答案要分两个市场:国内零售与整机渠道的时租大致在 9.6-12 元区间,部分平台会员价可以低至 9.58 元起;海外主流渠道折算后约 2.0-3.5 美元/小时,较 2024 年市场峰值下跌约 64%。9.58 元并不是某个平台的”促销价”,而是一条价格带的下沿:它由卡源的采购与折旧成本、机房的电力与散热成本、平台的运维与调度成本、以及渠道的会员折扣共同决定。理解了这条价格带的构成,你就能判断自己看到的任何报价是偏高、偏低还是正常。

    这篇文章分四步讲清楚 H100 的价格:先看国内与海外的价格全景,再解释这一轮下跌的供需原因,然后讨论按需与包月的分界点,最后给出一张”什么时候值得上 H100″的决策表。所有数字都是 2026 年公开市场报价的区间整理,用于建立量级判断,实际以各平台官网实时价格为准。

    价格全景:国内、海外与整机口径

    先明确口径。H100 与 H800 都是 80G 显存的高端卡,在国内属于供给受限的高端产品,因此国内价格显著高于海外;而 H800 是面向合规要求的产品版本,NVLink 带宽从 900GB/s 降到 600GB/s,其他规格接近,价格通常与 H100 同一带。整机月租则是企业级采购口径,H100 整机月租在 6.3 万元量级,不适合与按小时零售价直接换算。

    口径 价格区间 说明
    国内时租(H100/H800) 约 9.6-12 元/小时 会员价可低至 9.58 元起,高峰期需排队或加价
    海外时租 约 $2.0-3.5/小时 较 2024 年峰值跌约 64%
    整机月租(企业级) H100 约 6.3 万元/月 量级 含整机与配套,非按卡时折算
    同级国产/替代口径 H20 约 2.1 万元/月/卡 量级 保显存带宽、砍算力的产品定位

    把表读成一个结论:如果你在国内、按小时租、且不追求整机独占,那么 9.6-12 元/小时是当前对你的有效区间;如果你的业务可以放在海外节点或用海外账期,海外的 $2.0-3.5 会便宜一半以上,但要额外考虑网络延迟、数据出境与合规成本,这部分成本经常比价差更大。

    用这张表做预算时,建议用三步法。第一步,把你的任务折算成 GPU 小时——这需要先估出训练步数与单步耗时,得到一个量级;第二步,用你实际能拿到的单价乘以小时数,得到金额区间;第三步,为排队等待、试错重跑和数据处理各留出一部分余量。三步做完,你会得到一个”区间”而不是”一个数字”,这才是可以拿去做决策的预算。只用一个单价乘一个理想时长得出的结论,几乎总是偏乐观。

    跌 64% 的供需解释

    价格从 2024 年的峰值 8 美元量级跌到 2-3.5 美元,不是单一因素造成的,而是供给与需求两端同时变化的结果。

    供给侧的关键词是”放量”。新一代加速卡进入规模交付,云厂商与专业算力平台的高端卡池容量持续扩大;同时,早期已经回本的部分卡源进入更低价的市场分层。供给一旦从稀缺转向”结构性充裕”,最敏感的高端时租价格首先松动。

    需求侧的关键词是”结构迁移”。2024 年前后,市场对高端卡的需求主要由大模型训练驱动,训练对卡的互联带宽、显存容量要求苛刻,价格弹性极低;到了 2026 年,增量需求明显向推理倾斜。推理对单卡的算力与互联要求更宽容,可以用更多中端卡、甚至消费级卡承担,高端卡的边际需求因此下降。训练转推理,是这一轮价格回落最重要的背景。

    第三个小因素是租赁模式本身的成熟。当按需租赁成为标准配置、包月与预留产品线齐全之后,价格发现机制更充分,信息差被压缩,早期那种”加价抢卡”的空间自然收窄。这三个因素叠加,才构成了”腰斩”的结果。

    按需还是包月:150 小时是一条经验分界线

    H100 的价格对比不能只看时租单价,要把使用时长代入计算。行业里比较通用的经验是:月均使用超过 150 小时,包月通常比按需省 20-30%;低于这个量级,按需更划算,因为包月合同一般不退款,闲置时长就是浪费。

    把这条经验落到 H100 上:假设你按需使用,国内 9.6-12 元/小时,月均 150 小时意味着约 1440-1800 元的月度支出量级;如果包月产品给出 20-30% 的折扣,节省的绝对金额对个人开发者并不算大,但对一个持续训练的团队就是可观的固定成本优化。反过来,如果你的负载是”每月集中跑几轮实验”,每次几十小时,那么按需 + 关机不计费的组合更合适。

    需要额外考虑的是排队成本。高端卡在高峰期需要排队,包月或预留可以在一定程度上锁定可用性,这部分”确定性”本身就是价值,很难用小时价折算。

    海外与国内:三条容易被忽略的额外成本

    看到海外 $2.0-3.5/小时的报价,很多人的第一反应是”比国内便宜一半以上”。但在改预算表之前,至少要把三条额外成本算进去。

    第一是数据出境与合规成本。训练数据与模型权重的跨境传输需要评估合规要求,部分行业(金融、医疗、政企)存在硬性限制;即便不涉及敏感数据,跨境传输本身也会带来审计与合同层面的额外工作量。

    第二是网络延迟与带宽成本。如果数据留在国内、算力放在海外,每次迭代都要付出时延与流量费用,对数据读取频繁的训练任务影响尤其明显;如果数据也一起放到海外,则要考虑长期存储与访问的合规问题。第三是账期与结算成本,海外渠道通常需要外币结算与更长的账期,对现金流管理提出要求,汇率波动也会影响实际支出。

    把这三条加进去,”便宜一半”往往会被压缩到两成左右——仍然可观,但判断依据变了。这也解释了为什么数据落在国内的团队,即便看到海外低价,最终仍选择国内 9.6-12 元/小时的区间:省下的价差,不足以覆盖新增的合规与传输风险。

    H100 还是 H800:合规与互联的取舍

    国内做多卡训练时,经常需要在 H100 与 H800 之间选择。多数场景下两者可以互换,因为它们同为 80G 显存、算力接近,平台报价也常常在同一价格带。真正的差别在两处:一是 NVLink 带宽,H100 为 900GB/s,H800 为 600GB/s;二是合规背景,H800 是为满足特定合规要求而设计的产品版本。这一带宽差异对”卡间通信密集”的负载影响明显:当模型并行策略需要频繁在卡之间同步参数与梯度时,互联带宽会直接影响扩展效率;而当负载是单卡推理、或并行度较低时,差异对最终结果的影响有限。

    选型建议非常直接:如果你的并行策略是张量并行(TP)且规模较大,优先 H100;如果是数据并行(DP)为主、或单卡推理,H800 在价格相近时完全可以用;如果有明确的合规约束,则按合规要求选择即可。同一类逻辑也适用于 A800:它的互联带宽从 600GB/s 降到 400GB/s,属于同一系列的合规版本。

    什么时候值得上 H100:一张决策表

    你的场景 是否值得上 H100/H800 理由
    70B 级模型的持续预训练或多机微调 值得,且应优先保障互联 显存与卡间带宽是硬约束,中端卡难以替代
    大规模高并发在线推理(长上下文) 值得评估,先算并发账 单卡吞吐高,但需与多张中端卡方案对比总成本
    7B-13B 微调、实验性训练 多数情况不必 A100 或 4090 集群通常够用,单价低数倍
    AIGC 出图、LoRA 微调、教学 不必 4090/5090 级别即可满足,包月更省
    短期突发的高端算力需求 值得,用按需而非包月 避免为闲置付费,接受排队换取灵活性
    有严格合规要求的训练任务 按合规版本选择(H800 等) 带宽略有牺牲,换取合规可用

    这张表的用法是先找自己所在的场景行,再看”理由”列是否成立。如果理由是”显存与互联是硬约束”,那 H100 就是刚需;如果理由是”吞吐更高”,那就需要真的把并发账算清,再和替代方案比较,因为高端卡的单价是 A100 的两倍以上、是中端卡的四到八倍,量级差异必须用吞吐或时间价值来弥补。

    还有一类场景容易被误判:把”模型规模不大但上下文很长”的任务当成不需要高端卡。长上下文推理的显存占用会随上下文长度上升,缓存部分可能占据相当大比例的显存,这时即使模型参数量不大,也可能因为显存不足而无法提供目标并发。遇到这类情况,先在 A100 上做一次显存与并发的实测,再判断是否需要升级;很多时候升级的目标不是算力,而是显存容量与带宽。

    避坑与注意事项

    • 不要用海外报价直接对标国内预算。海外 $2.0-3.5 看起来便宜,但数据出境、网络延迟、账期与合规成本要一起算。
    • 不要忽略排队成本。高端卡高峰期排队明显,报价再低,排不上队也没有意义;凌晨与周末相对宽松。
    • 不要只看时租不看整机口径。6.3 万元/月 的整机报价与 9.6-12 元/小时 不是同一个东西,混算会得出错误结论。
    • 不要用消费级跑分推断 H100 性能。高端卡的价值在多卡互联与显存带宽,单卡跑分无法体现。
    • 不要跳过试用直接签长约。先用按需实例完成一次真实负载验证,再决定包月或预留。

    常见问题

    H100 价格还会继续跌吗?

    方向性判断可以看三个信号:高端卡的新增供给节奏、推理需求在总算力需求中的占比、以及新一代产品的发布与交付进度。推理占比继续上升、供给继续放量,价格下行的压力就持续存在;但高端卡的绝对价格也有成本底线,不太可能出现无限制下跌。做预算时建议用区间而非单点,并保留调整空间。

    国内 9.58 元起的会员价,和普通用户价差多少?

    会员价的本质是渠道折扣,通常对应更长的预付周期或更高的承诺用量。对低频用户来说,为了折扣而预付并不划算;对稳定使用的团队来说,折扣加上可用性锁定,整体价值更明显。判断标准还是那个 150 小时的量级分界。

    为什么 H800 价格和 H100 差不多?

    因为两者在显存容量、算力量级上接近,主要差异在 NVLink 带宽(900GB/s 对 600GB/s)与合规定位,而不是”性能档次”。市场把它当作同一档次的不同版本定价,价差因此有限。

    用 H20 替代 H100 划算吗?

    取决于你的负载是”显存敏感”还是”算力敏感”。H20 的设计思路是保留显存带宽、削减算力,量级报价约 2.1 万元/月/卡,适合显存与带宽受限、而算力需求相对温和的场景;如果是计算密集型训练,替代效果会打折扣。先明确瓶颈在哪一侧,再决定。

    预算有限时,有哪些降本替代路径?

    三条:把可中断的训练搬到中端卡并做断点续训;用 LoRA 等参数高效方法降低对显存与算力的要求;把”必须高端卡”的部分压缩到最短时长,其余环节放在 A100 或 4090 集群上。这三条组合起来,通常能在不明显延长工期的前提下显著降低高端卡的账时。

    总结

    H100 的价格全景可以用三句话概括:国内时租 9.6-12 元、海外 $2.0-3.5、较峰值跌约 64%;下跌由供给放量与训练转推理共同驱动;是否值得上 H100,取决于你的瓶颈是不是”显存与卡间互联”。9.58 元起这个数字,只是一个坐标——它的意义是让你在拿到任何报价时,能够立刻判断它在价格带里的位置。做决策前,请以各平台官网的实时价格与服务条款为准,并用一次真实负载的试用验证你的判断。