训练一个大模型到底要多少钱:从 DeepSeek-V3 的 557.6 万美元说起

结论先行:557.6 万美元是什么口径的钱

DeepSeek-V3 常被引用的训练成本是约 557.6 万美元,这个数字的来源很具体:训练消耗约 278.8 万 GPU 小时,按每小时 2 美元的口径折算得出。作为对比,Llama 3 405B 的训练消耗约 3080 万 GPU 小时,量级差了一个数量级。把这两个数字放在一起,能得出本文最重要的一个结论:衡量训练成本的标准单位不是”多少钱”,而是”多少 GPU 小时 × 单价”。

但这并不意味着训练一个大模型只要 557.6 万美元。这个数字对应的是”最后一次成功的正式训练”的算力账,不含数据构建、人力投入、失败实验的试错成本,也不含上线之后的推理支出。这篇文章要做的,就是把这个数字拆开,看清它包含什么、不包含什么,然后给中小团队一个可用的成本量级感,以及四条务实的降本路径。

GPU 小时计价法:唯一可比的成本口径

为什么用 GPU 小时而不是美元?因为美元金额受卡型、单价、租用方式影响,跨团队不可比;而 GPU 小时是任务本身的物理消耗,换一个单价就能换算成钱。它的计算方式很直接:

训练总成本 ≈ GPU 卡数 × 训练天数 × 24 小时 × 单卡小时单价。以 DeepSeek-V3 为例,278.8 万 GPU 小时 × 2 美元/小时 ≈ 557.6 万美元。这里的 2 美元口径对应的正是 H800 一类高端卡的海外带价水平——注意,同一份算力放在国内按 9.6-12 元/小时(约 1.3-1.7 美元)的时租口径下,金额会不同,这正是”先算 GPU 小时、再套单价”的意义。

这套算法还能解释为什么 Llama 3 405B 的 3080 万 GPU 小时会被反复提及:它代表了”用传统稠密模型路线训练一个更大参数模型”所需的算力量级。把 278.8 万与 3080 万放在一起,差距主要来自模型架构与训练效率的路线选择,而不只是硬件规模。

对比项 DeepSeek-V3 口径 Llama 3 405B 口径
训练算力消耗 约 278.8 万 GPU 小时 约 3080 万 GPU 小时
折算成本(按 2 美元/时) 约 557.6 万美元 按同一单价折算约 6160 万美元量级
成本口径 最后一次成功训练的算力账 同类口径的算力账

557.6 万美元不含什么

这是最容易被误读的一点。训练一个模型的真实投入,远不止那次成功训练烧掉的卡时。把完整成本拆成四块,结构会清楚得多。

一、数据成本

数据的采集、清洗、去重、配比与质量筛选,是长周期的人力与工程投入。高质量语料的获取本身可能涉及采购,而清洗流水线的开发与迭代需要持续投入工程师时间。这部分成本通常不体现在 GPU 小时里,但往往是决定模型效果上限的关键。

这笔成本还有一个特点:它随着模型规模的增长而放大。模型越大,对数据量与数据质量的要求越高,清洗与筛选的规则也越复杂。很多团队在算力上做了充足预算,却在数据环节投入不足,最终得到的结果是”卡时烧掉了,效果没出来”——从成本角度看,这比算力超支更浪费。

二、人力成本

一个完整的大模型训练团队包含算法、工程、数据、算力调度与评测多个角色,人员规模与周期决定了这部分支出的量级。以数月到一年以上的训练周期计算,人力成本在总投入中的占比经常不低于算力成本。

三、试错成本

“最后一次成功训练”这个表述本身就说明问题:在此之前会有多次失败的、被中途放弃的、超参不理想的实验运行。这些实验同样消耗卡时,也需要同样的集群规模,只是不体现在最终公布的那一个数字里。把试错倍数算进去,实际算力支出通常是公布数字的数倍量级。

试错成本对中小团队的意义尤其现实:如果一次实验要烧掉数天的多卡集群时间,团队就会本能地减少实验次数,而实验次数恰恰是模型效果的关键变量之一。这也是为什么”用便宜的中端卡多做几轮实验”经常比”用昂贵的高端卡做一轮完美实验”更有效——前者的总成本可能更低,得到的结论却更多。

四、推理与迭代成本

模型训练完成只是起点。上线后的推理服务是持续性支出,规模取决于用户量、上下文长度与并发;后续的版本迭代(继续预训练、微调、对齐)又是一轮算力投入。把训练成本当成一次性投入来做预算,是最常见的错误。

中小团队的量级感

对绝大多数团队来说,从零训练一个千亿级模型并不现实,真正需要算的是微调与中等规模训练的量级。这里给出的是基于公开经验的量级估算,具体数值会随模型规模、序列长度、批次与并行效率大幅波动,请当作判断量级的参考而非精确预算。

任务类型 典型卡型 算力量级(参考) 成本量级(按公开时租区间)
7B 模型 LoRA 微调 单张 4090(24G) 数小时到数十小时 数十元级
7B 模型全参微调 多张 A100 / 4090 数十到数百 GPU 小时 数百到数千元级
13B 模型 LoRA 微调 A100 40G 或 5090 级 数十 GPU 小时 数百元级
13B 模型全参微调 多张 A100 80G 数百到上千 GPU 小时 数千到万元级
70B 级继续预训练 H100/H800 多机集群 万级 GPU 小时以上 十万元级以上

在动手算之前,先把”需要多少 GPU 小时”这个问题拆成三个输入:模型规模(决定单步计算量与显存占用)、数据规模(决定训练步数)、以及硬件效率(决定实际吞吐与理论峰值的差距)。三者相乘才能得到量级。其中最容易出偏差的是第三项——理论峰值与实际吞吐之间通常存在明显差距,受制于显存带宽、通信开销、算子效率与集群调度。把效率系数设得乐观,预算就会被严重低估;务实的做法是按公开实践中较为克制的效率水平来估,再留出余量。

读这张表要注意两点。第一,卡型选择由显存决定:7B 级 LoRA 单张 24G 卡就能做,13B 级全参微调就必须用 40G 以上的卡。第二,成本随 GPU 小时线性放大,规模每上一个台阶,支出是数量级变化,而不是百分比变化。这也是为什么对中小团队来说,”要不要自己训练”这个问题,答案通常是”先用微调和开源模型验证需求”。

训练之后:推理才是长期账单

把训练成本算清楚之后,还有一个更容易被低估的部分:推理支出是持续性支出,而训练通常是一次性或阶段性的。一次 557.6 万美元量级的训练可能对应数年服务期,但如果推理的量级大,累计支出超过训练成本并不罕见。

推理成本的结构与训练不同:它由单次请求的计算量(受模型规模、上下文长度影响)、并发水平(决定卡是否被有效利用)、以及单位卡时价格三部分决定。因此推理降本的方向也与训练不同——训练关注吞吐与扩展效率,推理更关注”每单位请求的成本”,手段包括量化、缓存复用、批处理与更高效的解码策略。同一个模型,经过推理侧优化之后,单位成本可能下降数倍,这部分收益往往比砍训练卡时更容易拿到。

对做预算的团队来说,这意味着在立项阶段就应该把推理成本单独列一行,并估算预期的请求量级。只算训练账、把推理当成”上线后再说”,会让整个项目的投入产出判断失真。

降本四招

1. 混合精度:FP8 与 BF16 的取舍

降低数值精度是训练加速最直接的手段之一。以 FP8 混合精度为例,它通过降低激活与部分运算的数值位宽来减少显存占用与计算量,从而在同等硬件上获得更高的吞吐。代价是需要处理数值稳定性问题,对算子与框架支持有要求。实际收益取决于模型结构与实现质量,方向明确但幅度因项目而异——建议在小规模上先验证收敛性,再推到全量训练。

2. 架构选择:MoE 的稀疏性红利

DeepSeek-V3 与 Llama 3 405B 的 GPU 小时差异,很大程度上来自架构路线。混合专家(MoE)结构通过每次激活部分参数,让总参数量与激活计算量解耦,从而在推理与训练中摊薄单位效果的计算成本。代价是训练稳定性与通信复杂度更高,工程门槛也更高。对中小团队而言,更现实的用法是直接采用已经开源、以 MoE 为卖点的模型做后训练,而不是自己从头实现。

3. 租用弹性:把固定成本换成可变成本

自建集群意味着为峰值需求买单,而训练任务往往有明显的阶段性:数据准备期算力闲置、集中训练期算力紧张。用弹性租用替代自购,可以把固定成本转化为随任务伸缩的可变成本。这里的关键经验是月均使用 150 小时以上的稳定负载才考虑包月,否则按需更划算;高端卡高峰期要排队,把可中断的训练安排在凌晨与周末能显著降低成本与等待。

4. 开源模型:站在已有的 GPU 小时上

最彻底的降本方式是少烧卡时——直接使用开源基座模型做微调或后训练,而不是从零预训练。以公开数据看,一个 70B 级继续预训练就要万级 GPU 小时以上,而 7B-13B 的微调只需数十到上千 GPU 小时,两者相差两到三个数量级。对绝大多数业务场景来说,微调开源模型已经能覆盖绝大部分需求。

四招之间不是孤立的,组合使用效果更明显:用开源模型做基座(省掉预训练)、用混合精度与高效微调方法压缩算力需求(省掉单次训练成本)、用弹性租用匹配波动的算力需求(省掉闲置成本)。三条路径合起来,中小团队完全可以用可承受的预算完成一个可用的领域模型——这与”训练一个大模型要几百万美元”的印象并不矛盾,因为后者的口径本身就是从零预训练一个超大模型。

常见问题

557.6 万美元能训练出一个 GPT-4 级模型吗?

不能这样理解。557.6 万美元是特定模型在特定口径下最后一次成功训练的算力账,对应的技术路线、数据积累与工程能力是前提条件。把它当作”训练同类模型的普遍预算”,忽略了数据、人力与试错投入,会严重低估实际门槛。

为什么用 GPU 小时而不是直接用美元?

因为 GPU 小时是任务的物理消耗,与卡价无关;美元金额会随卡型与租用方式变化。用 GPU 小时做单位,可以跨团队、跨时期比较训练效率;需要换算金额时,再乘以你实际能拿到的单卡小时单价即可。

中小团队最主要的成本误区是什么?

三个:把训练当一次性投入(忽略推理与迭代);用峰值需求配置固定资源(忽略租用的弹性);高估自己从零训练的必要性(忽略了微调开源模型的可行性)。避免这三点,预算通常会合理得多。

自建集群和租用,哪个训练更划算?

取决于利用率。行业经验是利用率超过 70% 才值得评估自购,因为低于这个水平时,闲置的设备折旧、电费与运维成本会超过租用溢价。训练任务波动大,通常更适合”基线自购 + 峰值租用”的混合策略。

MoE 一定比稠密模型省吗?

在”单位效果的计算成本”这个维度上,MoE 的稀疏性通常带来优势;但它引入了训练稳定性、通信开销与工程复杂度,不是无条件的优化。是否采用,取决于团队是否有相应的工程能力与调优经验。

总结

从 557.6 万美元说起,最重要的收获不是一个价格标签,而是一套算法:训练成本 = GPU 小时 × 单价,而这个 GPU 小时只覆盖最后一次成功训练。完整的投入还要摊上数据、人力、试错与推理。对中小团队来说,务实的路径是先算清自己任务的 GPU 小时量级,再决定用哪一档卡、按需还是包月,最后优先考虑微调开源模型而不是从零训练。把这三个决定做对,成本控制的大头就已经完成了。文中所有成本与规模均为公开信息的量级整理,实际以各平台与厂商官方渠道的价格与规格为准。

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *