追踪什么
大模型子栏目关注的是模型侧的成本与工程变化,以及这些变化如何反过来影响算力租赁市场。具体分三条线:训练成本、推理落地、开源模型生态。
训练成本
训练的算力成本可以用 GPU 小时乘以单价来估算。公开资料中常被引用的一组对照是:DeepSeek-V3 的训练约消耗 278.8 万 GPU 小时,按 H800 每小时约 2 美元的口径估算约 557.6 万美元;而 Llama 3 405B 的训练消耗约 3080 万 GPU 小时,量级上高出一个数量级。需要强调的是,这类数字通常只覆盖最后一次成功训练的算力开销,不包括数据准备、人力、失败试验与推理成本。理解这一点,才能正确使用这些数字做量级判断,而不是当成完整预算。
推理落地
推理成本的变化比训练更直接影响日常使用。公开的 API 定价口径通常按每百万 token 的输入与输出分别计价,不同厂商之间的量级差距较大,且随模型版本与促销策略持续调整,因此本站只记录口径与量级关系,不写死具体数字。对自部署团队而言,单位成本取决于卡时费用、并发利用率与运维开销三者的乘积。
开源模型生态
开源权重模型的迭代速度,决定了中小团队能否用有限的算力做出可用的产品。模型效率的提升(更小的激活参数、更高效的注意力实现、更成熟的量化方案)会直接降低对显存和算力的要求,进而改变租用市场的需求结构。
2026 年值得关注的信号
- 推理成本持续下降:量化、批处理、KV cache 优化等工程手段的普及,让单位 token 的成本继续走低,这会削弱必须使用最高端卡的论调。
- 小模型普及:面向垂直场景的小参数模型在性价比上更有优势,对应的算力需求向 24G 至 48G 档位集中。
- 国产算力参与训练:以昇腾 910B 为代表的国产卡在推理场景已有落地,训练侧则受限于生态适配周期——公开信息显示 CUDA 到 CANN 的迁移通常需要 3-6 个月的适配期。
- 训练与推理需求占比变化:当推理需求占比上升时,市场对高端训练卡的需求增速会放缓,这是高端卡价格回落的重要背景。
与算力租用的关系
模型侧的每一个变化,最终都会传导到租用决策上。推理成本下降意味着同样的预算可以支撑更多并发,团队会更倾向于把资源集中在推理实例而不是训练集群;小模型普及意味着 24G 档位的卡型(如 RTX 4090)需求上升;国产算力生态成熟则为企业提供了合规的替代路径。反过来说,当你评估一次模型训练或部署的预算时,也应该把上面这些结构性变化考虑进去,而不是直接套用历史上的成本模型。