算力租用还是显卡自购:四笔账算清楚

结论先行:不要比价格,比利用率

算力租用还是显卡自购,这个问题用价格永远算不清,因为两者的成本结构完全不同:租用是可变成本,用多少付多少;自购是固定成本,先付一笔钱,然后慢慢摊。把这两种成本放在一起比较,唯一的公平方式是把它们换算成”每小时的实际成本”,而这又完全取决于一个变量——利用率。

行业里比较通行的经验是:利用率超过 70%,才值得认真评估自购;低于这个水平,闲置带来的折旧、电费与运维成本会迅速吃掉自购的价格优势。所以本文不打算先给结论,而是先把四笔账摆开:设备折旧、电费与机房、运维人力、机会成本。算完之后,再用 H100 的公开价格做一个盈亏平衡的估算,最后给出混合策略与决策表。

第一笔账:设备折旧

自购的第一笔支出是硬件本身。以高端训练卡为例,单卡购置价格在 2.5-3 万美元的量级,整机还要加上 CPU、内存、主板、电源、机箱与高速互联部件,实际整机价格往往是单卡价格的若干倍。这笔钱一旦付出,就进入折旧周期。

折旧的关键认知是:算力硬件的价值衰减速度较快。新一代产品发布后,旧卡的租赁市场价会明显下移(H100 租赁价较 2024 年峰值跌约 64% 就是例子),因此自购设备的会计折旧年限与经济折旧年限经常不一致。如果按三年直线折旧来分摊,一台 3 万美元量级的设备每天的成本就接近 30 美元——注意,这是”每天”,无论你用不用。

第二笔账:电费与机房

这是最容易被低估的一笔。高端卡的功耗本身可观,而整机功耗还要加上 CPU、电源转换损耗与散热。真正的成本大头在散热:把卡产生的热量排出去,需要机房级的空调或液冷系统,其耗电经常与计算设备本身处于同一量级。折算下来,电费加上散热,会让”每小时运行成本”在硬件折旧之外再增加一个可观的份额。

如果不在自有场地,还要加上机柜租金、带宽与机房的运维服务费。这几项通常按月计费,同样与利用率无关。对个人开发者来说,在办公室或家里跑一张高端卡并不现实——噪音、供电、散热都是硬约束,这意味着自购基本等同于”租一个机房位置”,只是设备所有权不同。

还要考虑供电余量。高端卡的瞬时功耗较高,多卡整机对配电容量、线路规格与不间断电源都有要求;一旦需要改造电力环境,这笔支出会进一步抬高自建门槛。相比之下,租用平台的这部分成本被摊薄在所有用户上,这也是租用溢价的一部分来源。

第三笔账:运维人力

设备买回来只是开始:驱动与框架的版本管理、集群调度软件的部署、故障排查与硬件维修、备件与替换、安全补丁与网络配置,都需要人来做。大集群还需要专职的运维或平台工程角色。

自建集群还需要考虑冗余与备件:硬件总有故障率,一块卡坏了可能让整个多卡任务中断,因此需要准备备用卡、备用电源与替换流程。这些冗余设备平时不产生收益,却必须购置与维护;而租用平台上,故障替换由平台承担,用户只需要重新调度任务。把冗余成本计入之后,自购的真实单位成本会进一步上升。

这笔账难算的地方在于它是隐性成本:当团队规模小的时候,这些工作会摊到算法工程师身上,表面上看不出额外支出,但会真实地消耗研发时间。衡量方式可以简单地用”每月占用多少工程师工时”来估算,再按人力成本折算。很多团队在算完这笔账之后,会发现租用的溢价其实是”买了一支运维团队”。

第四笔账:机会成本

最容易被忽略的一笔。自购意味着把一笔现金锁定在会持续贬值的硬件上,这笔钱本可以投入到数据、人才或产品上;也意味着弹性丧失——当业务量突增时无法快速扩容,当模型方向调整时无法快速换型。反过来,自购也有好处:长期稳定的负载、对数据物理隔离有硬要求、或需要极致性能调优的场景下,独占硬件能带来确定性与可控性。

机会成本还包括技术路线风险。如果未来两年主流卡型或互联标准发生变化,自购的集群可能面临”能用但不再高效”的处境,而租用方可以直接切换。把这一点纳入评估,很多看起来划算的自购方案会变得不那么划算。

还有一个常被忽略的层面是资金的灵活性。把一笔钱用于购置硬件之后,它对业务的响应能力就固定下来了;而在业务早期,方向调整频繁,把钱留在手里或投向数据与人才,往往能产生更高的回报。衡量机会成本并不需要精确的计算,只需要问一个问题:这笔钱如果不买卡,还能用在哪些地方,那些地方的边际收益是否更高?如果答案不确定,租用提供的”随时收手”能力就很有价值。

盈亏平衡:用 H100 算一次

把四笔账简化成一个估算模型。以高端卡为例,取公开口径:单卡购置价格约 2.5-3 万美元量级,海外时租约 2-3 美元/小时。只考虑硬件折旧、暂不计电费与运维,简单的盈亏平衡点计算如下:

年利用率 年运行小时数 按 2.5 万美元购置的硬件摊销(按 3 年) 按 2.5 美元/时租用的年支出 粗略结论
20% 约 1752 小时 约 8333 美元/年 约 4380 美元/年 租用明显更省
50% 约 4380 小时 约 8333 美元/年 约 10950 美元/年 接近平衡,自购略优
70% 约 6132 小时 约 8333 美元/年 约 15330 美元/年 自购占优,但需扣电费与运维
90% 约 7884 小时 约 8333 美元/年 约 19710 美元/年 自购优势明显

这张表说明了两件事。第一,平衡点大致落在 40%-50% 的利用率附近——但这是”只看硬件折旧”的简化模型,把电费、散热、机柜与运维加进去之后,实际平衡点会上移到 70% 左右。第二,利用率越低,自购的劣势越明显,因为固定成本不随使用量下降。这就是”利用率超过 70% 才评估自购”这条经验的由来。

需要提醒的是,上述模型是量级估算,用于说明结构而非给出精确结论;实际数值取决于你拿到的采购价、电价、机房成本与租用折扣,请以实际报价为准。

哪些情况下自购是明确正确的

虽然大多数团队更适合租用,但确实存在几类场景,自购或长期独占是更合理的选择,值得单独说明,避免把”租用更灵活”当成一条无条件的结论。

第一类是数据物理隔离有硬要求的场景。当合规要求决定数据不能离开特定物理边界时,租用公共算力平台在合规层面可能直接不可行,此时自建或专有环境的成本是必须支付的合规成本,而不是可以优化的对象。

第二类是长期、稳定、高负载且可预测的任务。比如常驻的推理服务,如果请求量稳定、卡长期处于高负载,那么自购的单位成本优势会随时间显现。这类任务的特征是”利用率曲线平坦”——没有明显的波峰波谷,固定成本因此可以被充分摊薄。

第三类是需要极致性能调优的场景。独占硬件意味着可以针对具体拓扑做网络与存储调优、可以控制内核版本与调度策略、可以排除邻居干扰。对延迟极度敏感的服务,这种可控性本身就是价值,难以用价格衡量。

反过来,判断是否属于这三类,可以问自己三个问题:数据是否必须留在本地?负载曲线是否平坦且长期高位?性能调优的收益是否已经超过运维投入?三个问题都答”是”,自购才真正成立。

混合策略:基线自购 + 突发租用

对多数团队来说,二元选择本身就是伪命题。更现实的做法是分层:

  • 基线负载自购或包月。把稳定、可预测、长期占用的那部分算力(比如常驻的推理服务、固定的训练流水线)配置成自购设备或长期包月,锁定单价。
  • 突发负载按需租用。把峰值、实验、临时扩容的部分交给按需实例,避免为峰值购买硬件。
  • 特殊卡型不购。只在少数项目用到的卡型(高端训练卡、超大显存卡)一律租用,不为低频需求付出购置成本。
  • 保留一键切换能力。容器化与镜像化管理,确保工作负载可以在自建与租用之间迁移,避免被单一环境锁定。

这套组合的核心思想是:让固定成本只覆盖确定的部分,把所有不确定性交给可变成本承担。它同时解决了成本与弹性两个问题。

决策表

你的情况 建议 理由
利用率长期低于 40% 租用 固定成本无法摊薄,闲置成本高于租用溢价
利用率约 50%-70% 租用为主,评估包月 包月可省 20-30%,且保留了弹性
利用率稳定高于 70%,负载可预测 评估自购 固定成本被充分摊薄,长期单位成本可能更低
负载波动大、峰值高 混合:基线自购/包月 + 峰值租用 避免为峰值购置硬件,同时锁定基线成本
数据必须物理隔离 自购或专有环境 合规与安全要求优先于成本考量
个人开发者或小团队 租用 缺少机房、供电与运维条件,隐性成本极高
需要频繁试新卡型 租用 避免技术路线变化带来的资产风险

避坑清单

  • 只算硬件钱。电费、散热、机柜、带宽与运维经常被漏掉,这几项能把单位成本抬高一个可观的幅度。
  • 用峰值需求决定采购规模。按峰值买设备,等于全年为闲置付费;按基线买、峰值租,才是更合理的结构。
  • 忽略经济折旧。新卡发布后旧卡租赁价快速下移,会计折旧年限不等于真实贬值速度。
  • 把运维当成”顺手做掉”。驱动、调度、故障、备件都会持续消耗工程师时间,隐性但真实。
  • 不做退出规划。自购设备的处置、迁移与兼容性要在采购时就考虑,否则退出成本会很高。

常见问题

利用率怎么算?

用卡的实际占用时长除以可用时长。实际占用包括训练、推理与数据处理,但不包括排队、空闲与调试中断。行业经验是利用率超过 70% 才值得认真评估自购,低于这个水平,租用的弹性优势通常更划算。建议连续统计一个月以上的数据再下结论,避免被短期峰值误导。

自购能省钱吗?

在利用率足够高、负载足够稳定的前提下,长期单位成本可能低于租用。但省下的钱要以占用现金、承担技术路线风险、以及自建运维能力为代价。判断的关键是:你是否有稳定的高利用率,以及是否具备运维团队或愿意投入相应人力。

小团队适合自购吗?

通常不适合。小团队缺少机房、供电、散热与运维条件,这些隐性成本会迅速抵消硬件上的价格优势;同时业务方向可能快速调整,硬件资产的灵活性损失代价更高。更现实的选择是租用,把资本留给数据与人才。

混合策略会不会更复杂?

会增加一定的环境管理成本,但可以通过容器化与统一的镜像管理把复杂度控制在可接受范围内。相比”为峰值买单”或”完全受制于单一平台”,混合策略的复杂度支出通常是值得的。关键是保持工作负载的可迁移性。

多长时间能回本?

取决于利用率、购置价与实际时租。以高端卡 2.5-3 万美元的购置量级与 2-3 美元/小时的时租口径粗略推算,在接近满负荷运行的假设下,回本周期大致在一年多的量级;利用率减半,回本周期就会显著拉长,甚至永远无法回本。这个估算只用于说明量级,实际请以你拿到的报价为准。

总结

算力租用还是显卡自购,答案不在价格表里,而在你的利用率曲线上。四笔账——设备折旧、电费与机房、运维人力、机会成本——共同决定了自购的真实单位成本;把它们全部摊开后,平衡点通常落在 70% 左右的利用率。低于这条线,租用更划算且更灵活;高于这条线且负载稳定,可以认真评估自购;而绝大多数团队的最优解,是”基线自购或包月 + 突发按需租用”的混合结构。所有价格与成本均为公开信息的量级整理,请以实际报价与合同条款为准。

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *