像 Kimi K3、GLM-5.2 以及 DeepSeek-V4-Flash 这类开放权重(Open Weights)模型,能力已经非常接近顶尖闭源模型。在很多日常开发和常规业务场景里,不少团队都已经把它们用上了。
在不需要物理隔离强合规的场景下,大家普遍会遇到一个很现实的选择:到底是用厂商按月发行的订阅席位、直接调用云端 API,还是自己买显卡搭自托管节点?
如果自己买硬件自托管,到底多长时间能回本?
市场上对自托管回本周期的说法相差巨大——有的说两个月,有的说一年多,还有的说要二十几年。这些算账结果其实都没错,差异的核心在于对比基准错位了:自托管本身并没有固定的物理回本周期,它跑得快慢,完全取决于你拿它去替代云端的哪种计费产品。
如果抛开前缀缓存(Prompt Cache)的优惠,只看每一次请求都是独立调用的冷启动基准场景,自托管替代的就是云端按量 API 的标准全量标价。
先看 GLM-5.2。在企业级部署中,该场景通常采用 8 张 H200 节点。这由模型的参数量决定:GLM-5.2 拥有约 753B 总参数与 40B 激活参数,FP8/W4A16 权重显存占用近 750GB,加上 1M 上下文推理时产生的 KV Cache,整机显存开销超过 1TB。配置 8 张 H200(单卡 141GB HBM3e,8 卡共 1,128GB 高速显存),通过 NVLink 走 8 卡张量并行(TP8)可实现高吞吐运行。这样一台标准的 8×H200 节点,规划采购成本约为 40 万美元。
按照美国 EIA 商业电价(0.1354 美元/度,包含 PUE=1.2 设施用电)计算,这台节点整年运行电费约 1.42 万美元。参考 Phala 测试 在 8K 输入、1K 输出负载下的数据,节点综合吞吐达到 733 output tok/s。
云端 API 的全量标价中,GLM 输入为 1.40 美元/M,输出为 4.40 美元/M。按 8:1 的输入输出比例折算,每生成 1M 输出 Token 对应云端 API 标价 15.60 美元。在 24 小时满载运转前提下,8×H200 节点全年产出的 Token 相当于替代约 36.06 万美元的理论云端 API 标价(注:此数字为满载容量乘标价算出的理论等价额,不代表团队原本必定发生的现金支出)。扣除 1.42 万美元电费后,硬件回本周期为 1.15 年。
桌面级多卡方案(以 DeepSeek-V4-Flash 为例)的硬件需求则截然不同。
DeepSeek-V4-Flash 采用了 Flash MoE 架构(约 284B 总参数,13B 激活参数),官方 FP8 权重占用约 159.6GB 显存。采用两块 96GB 显存的 RTX PRO 6000 Blackwell 桌面级显卡(双卡共 192GB 显存),即可实现官方权重的全显存驻留与 KV Cache 运行,硬件成本为 3.25 万美元。
整机功耗约 0.85 kW,按住宅电价(0.1844 美元/度)算年电费 1,373 美元。参考 LinkedIn 公开运行记录,系统前缀读取 10,000 in/s,解码 697 decode/s,串行折算综合吞吐约 447 output tok/s(注:此处为前缀与生成分阶段串行折算值,非端到端实测)。
DeepSeek 云端全量标价为输入 0.14 美元/M,输出 0.28 美元/M,8:1 比例下每 1M 输出 Token 对应 API 标价 1.40 美元。全年满载产出相当于替代约 1.98 万美元理论 API 账单。扣除电费后,回本周期为 1.77 年。
在此类冷请求基准场景下,这两个典型案例对标公开 API 标价的回本周期维持在 1.15 年至 1.77 年 区间。
到了多轮 Agent 交互场景,情况就不一样了。多轮对话会携带很长的历史记录,每次交互都在重复读取前面轮次的内容。
这里不能直接把刚才无缓存场景的吞吐数据拿过来用。因为 Prompt Cache(前缀缓存)不仅改变了计费,还改变了显卡的物理运行速度。在超长对话里,如果每次都重新读取前缀,计算延迟会非常高;而一旦缓存命中,显卡可以直接复用显存里的 KV Cache,前缀读取瞬间完成,整台机器的吞吐特征和冷启动完全是两码事。所以必须使用专门针对长上下文缓存重放的实测或投影数据。
参考 LMSYS SGLang 重放测试 的固定 OpenHands 重放数据集,典型 Agent 任务包含 13 轮对话,平均每轮 8 万个逻辑输入 Token 和 220 个输出 Token,逻辑输入与输出比例在 300 到 400:1 的量级(约 363.64:1)。
云端 API 对这种长上下文普遍提供 Prompt Cache 折扣。假设 92% 的逻辑输入命中缓存,按便宜的缓存价格计费,只有 8% 按全新输入计费。
这个时候,云端 API 的缓存折扣单价就成了拉开回本周期的核心杠杆。
对比两家的云端缓存单价: - Z.AI 计费标准 GLM 缓存输入单价为 0.26 美元/M。 - DeepSeek API 计费标准 DeepSeek 缓存输入单价为 0.0028 美元/M。
GLM 的云端缓存单价是 DeepSeek 的近 93 倍。这个价差直接让两者的回本周期发生了分化:
在 GLM-5.2 方面,为了与 LMSYS 官方 SGLang 实测数据集保持对标(在 8×B300 节点上测得 500 output tok/s 吞吐),硬件采用 8×B300 节点,并以第三方 DGX B300 完整系统作为经济替代参考(规划成本 $400k-$500k,整机功率 14.5 kW,包含 PUE=1.2 设施用电,年电费约 2.06 万美元)。
在云端 API 侧,GLM 未缓存输入 $1.40/M,缓存输入 $0.26/M。在 92% 输入按缓存计费的假设下,综合平均输入单价降至 $0.3512/M(较全量输入单价整体下降约 74.9%)。结合 363.64:1 的输入输出比例,生成 1M 输出 Token 对应的理论 API 费用为 132.11 美元。这台 B300 节点全年满载跑出来的 Token,在云端相当于 208.31 万美元理论 API 标价。扣除 2.06 万美元电费后,硬件回本周期为 0.19 到 0.24 年(2.3 到 2.9 个月)。
对于 DeepSeek-V4-Flash,由于缺乏同等 OpenHands 重放,此处采用分阶段投影估算:在同样假设 92% 前缀复用(串行折算吞吐约 230 output tok/s)的条件下,由于 DeepSeek 官方给的缓存价格极其便宜(0.0028 美元/M),云端 92% 缓存下的综合输入单价仅为 0.013776 美元/M,在云端跑长上下文本身的理论开销就很低。双卡节点一年跑出来的 Token,在云端仅相当于 3.84 万美元理论账单。扣除电费后,回本周期为 0.88 年(约 10.5 个月)。
逻辑非常清晰:云端 API 缓存单价越便宜,在云端跑长上下文的费用就越低;买硬件替代云端账单能省下的差价越小,自托管硬件回本自然也就越慢。
如果团队平时不用 API,而是给员工购买按月订阅的席位(比如 Coding Plan Max),算自托管的账时会得到一个与 API 口径完全不同的结果。
单个 Coding Plan Max 席位一年要 1,344 美元。如果直接拿一台 40-50 万美元的 8×B300 节点去跟 1 个订阅席位对比,节点全年的电费(2.06 万美元)早就超过了席位年费,算出来的年净收益是负的(-19,294 美元)。
这种对比忽略了用量对齐:单个订阅席位允许消耗的 Token 配额是有上限的(单席位常态上限约 8,000 次/周),1 个席位允许的用量远低于整台节点满载跑出来的产能。要想做客观对比,必须把两边的用量拉平——也就是计算要产生这台节点的总 Token 产能,按配额上限折算究竟需要购买多少个订阅席位。
在 500 tok/s 满载状态下,单台 8×B300 节点每周能跑出 3.02 亿个输出 Token(约 10.5 protocol 万段 13 轮 OpenHands 对话)。参考 DevPack FAQ 的配额扣减规则(每天 4 小时峰值按 3 倍扣额,20 小时常态按 2 倍扣额,周加权扣额系数约 2.1667 倍),节点产能映射到订阅系统里,每周消耗约 22.91 万次配额。
根据 DevPack 说明文档,单个 Max 席位每周的常态配额上限约为 8,000 次。消化掉这台节点的满载产能,在数学上至少需要 29 个 Max 订阅席位。
29 个席位一年的订阅总费用是 3.89 万美元。扣除节点全年的 2.06 万美元电费后,每年净省下的金额其实只有 1.83 万美元。针对 40-50 万美元的硬件投资,同量配额口径下的回本周期瞬间拉长到了 21.8 年到 27.3 年(约 22 到 27 年)。
这揭示了 API 计费与包月订阅制在定价机制上的本质不同:云端 API 按用量线性计费;而包月订阅席位在单人定价里包含了大额的打包折扣。拿自托管硬件去替代包月席位,回本周期会从 API 口径下的几个月,陡增到二十多年。
自托管硬件多久能回本,从来不是显卡本身的价格决定的,而是取决于你的业务负载特征以及你拿它去替代云端的哪种计费模式。
下面把不同场景下的物理参数、运维电费和回本周期测算整理成汇总表,供大家在架构选型和采购评估时参考:
| 模型与硬件节点 | 硬件采购成本 (CAPEX) | 年运行电费 | 对标云端计费口径 | 吞吐与工作负载假设 | 理论年 API/订阅等价额 | 扣除电费后年净额 | 条件化简单回本周期 |
|---|---|---|---|---|---|---|---|
| GLM-5.2 (8×H200) | $400,000 | $14,233.25 | 云端冷缓存 API | 8K in / 1K out,733 tok/s | $360,607.85 | $346,374.60 | 1.15 年 (约14个月) |
| DeepSeek-V4-Flash (2×RTX PRO 6000) | $32,500 | $1,373.04 | 云端冷缓存 API | 10k in/s 读取,697 decode/s (折算 447.48 tok/s) | $19,756.57 | $18,383.53 | 1.77 年 (约21个月) |
| GLM-5.2 (8×B300) | $400,000 - $500,000 | $20,638.21 | OpenHands Agentic API (92% 缓存) | 500 tok/s 满载,输入输出比 363.64:1 | $2,083,096.15 | $2,062,457.94 | 0.19 - 0.24 年 (2.3 - 2.9 个月) |
| DeepSeek-V4-Flash (2×RTX PRO 6000) | $32,500 | $1,373.04 | OpenHands Agentic API (92% 缓存) | 230.21 tok/s 投影,输入输出比 363.64:1 | $38,401.36 | $37,028.32 | 0.88 年 (约10.5个月) |
| GLM-5.2 (8×B300) | $400,000 - $500,000 | $20,638.21 | Coding Plan Max 单席位订阅 | 500 tok/s 满载 | $1,344.00 | -$19,294.21 | 无法有限回本 (分母为负) |
| GLM-5.2 (8×B300) | $400,000 - $500,000 | $20,638.21 | Coding Plan Max 同量席位 (29 席) | 500 tok/s 满载,映射 229,091 prompts/周 | $38,976.00 | $18,337.79 | 21.8 - 27.3 年 (约22 - 27年) |
需要注意,上述测算基于节点 24 小时满载且仅计入硬件采购与基础电费(理论 API 标价额仅表示满载容量乘标价算出的理论等价额,不代表已发生的现金节省)。实际落地时,还需要把机柜租金、网络带宽、运维人力以及停机冗余等隐性成本考虑进去。
评估自托管 ROI 的真正起点,在于搞清楚团队真实的上下文重复率、云端缓存折扣单价,以及到底是在替代 API 还是包月订阅席位。