过去这一天,我家里那台常驻服务器上的 2 张 32GB RTX 5090 组了 TP=2 张量并行,用 SGLang 跑 NVFP4 浮点量化版 Qwen-3.8-27B。翻了下 08-23 的监控记录:这台 27B 模型一天处理了约 2.24 亿 prefill token,其中 1.82 亿是前缀缓存命中、几乎不占算力,真正新生成的 decode token 约 225 万。按美国能源信息署(EIA)民用电价 $0.1844/kWh、整机满载约 500W 来算,一天里真正在出 token 的时间只有约 3.8 小时,折算到月度电费大概 $11。
要是把这种生成负载拿去对标商业 API 的订阅套餐(比如 GPT-5.6 Luna 搭配 Codex $200 套餐),平均每天成本大概 $1,一个月算下来约 $30。单看账面支出,即使是像这样一天处理几亿 token 的重度使用,自建一天 3.8 小时负载的电费(约 $11/月)一个月也就比订阅省个 $20 左右。但初始硬件投入摆在那里,光两张 5090 加上整机就要 $6,000–8,000,靠每月 $20 上下的电费差价去摊这 $6,000–8,000 的硬件,要 25–33 年才回得了本,纯靠省钱是完全回不了本的。所以自托管的理由不在省钱,我图的是数据完全留在本地介质上的合规与隐私、模型行为的无审查定制、全量微调与 LoRA 权重的动态插拔、哪怕断网脱机也能稳稳工作的确定性,还有一整套自己完全掌控的推理软件栈。从实测数据来看,双卡 5090 跑 27B 级别小模型,解码吞吐充裕:开到 8 路并发,每路依然能提供 141 tok/s 的速度,是当下消费级硬件的 sweet spot。当然,决定选型的核心依据还是业务的实际负载使用率,脱离使用率盲目追求单流速度很容易落入配置误区。
为了摸清 2×5090 的实际吞吐能力,我用同一道标准数学推理题目做了并发压测。在关闭思考模式、max_tokens 设定为 1024 的基准条件下,从单路并发逐步加压至 8 路并发,记录不同梯度下的整体吞吐与单流解码速率:
| 并发 | 总吞吐 tok/s | 单流 decode tok/s | 扩展倍率 |
|---|---|---|---|
| 1 | 268 | 286 | 1.00× |
| 2 | 461 | 253 | 1.72× |
| 4 | 692 | 196 | 2.58× |
| 8 | 962 | 141 | 3.59× |
总吞吐是整机所有并发请求的合计(token 总数除以墙钟时间,含 prefill),单流 decode 是单请求纯解码速率(不含 prefill)。并发=1 时两者只差一个 TTFT 的摊销,所以 268 略低于 286。
双卡并行跑多任务很顺畅,只要加并发,整机总吞吐几乎线性上涨。从单路并发的 268 tok/s 到 8 路并发的 962 tok/s,扩展倍率 3.59 倍,说明 8 路并发以内,双卡 TP=2 走消费级 PCIe 总线的数据交换没成为瓶颈。与此同时,并发加到 8 路时,每路独立的单流生成速率依然维持在 141 tok/s。对比人类自然阅读速度(约 200–300 词/分钟),141 tok/s 留了充裕的余量,系统的实际瓶颈不在模型,而是转移到了下游消费能力或上游任务派发节奏上。
换到投机解码和长文本场景,双卡依然能跑出可观的生成速率。配合 DFlash2 算法,实测投机 accept 步数分布在 3.3–5.6 之间,数学任务实测吞吐为 215–256 tok/s,代码生成任务为 222–232 tok/s。对照 SGLang 官方 cookbook 在单张 5090 上的 DFlash2 标准测试数据(输入 8192、输出 1024、并发 1 下测得 206.1 tok/s),本地双卡 TP=2 实测单流 286 tok/s 优势明显。在包含 5 条 16k 长度文档的长文本测试集上,开启思考模式平均吞吐为 156.1 tok/s,关闭思考模式平均吞吐为 195.4 tok/s,其中结构化 JSON 抽取任务实测峰值达到 334 tok/s。
如果以单流解码速率不低于 100 tok/s、整机总吞吐量不低于 500 tok/s 作为 27B 实用门槛,2×5090 应对起来绰绰有余:4 路并发时就做到 196 tok/s 单流、692 tok/s 总吞吐,8 路并发单流仍保持 141 tok/s,全面超过基准线。RTX 5090 成为承载 27B 小模型的 sweet spot,在于四个硬件维度同时满足:Blackwell 架构原生集成的 FP4 tensor core 提供高效的 NVFP4 计算支持、1792 GB/s 的显存带宽、32GB 的单卡物理显存,以及每卡 $2,000 的官方指导价。定位更高的专业卡没带来显存带宽增益,价格更低的旧款显卡则卡在量化支持与显存容量两道断层上。具体的部署配置与稳态运行数据见文末附录。
想用上一代旗舰 RTX 4090 来做自托管,最直接的问题就是速度不够快。大模型的吐字速度主要看显存带宽。4090 配备 24GB GDDR6X 显存,带宽只有 1008 GB/s,刚好是 RTX 5090(1792 GB/s)的 56%。显存带宽成了硬上限,4090 在单流解码阶段的生成速率比 5090 直接慢了约 40%。
更麻烦的是量化格式。最新的 NVFP4 格式必须依靠 Blackwell 架构自带的 FP4 tensor core 硬件单元。4090 基于上一代 Ada Lovelace 架构,没有 FP4 硬件指令支持,跑 4-bit 量化时只能退回去用传统的 INT4 格式(如 AWQ、GPTQ、AutoRound),或者用显存占用更大的 FP8 格式。来自 RaZeR 论文 与量化评测研究 的数据表明,NVFP4 采用浮点表示与动态步长机制,动态范围达到 12,高出 INT4 的 7 一大截,能更准确地保留权重分布里的长尾特征,模型输出质量普遍优于 INT4。而且 INT4 做张量乘法前得先把权重反量化成 16-bit 浮点,白白多一道计算开销。
显存容量也处处受限。27B 模型在 NVFP4 格式下的基础权重是 20.14GB,要是加上 3.38GB 的 DFlash2 投机解码草稿模型,显存总占用就到了 23.5GB。4090 的 24GB 显存塞下投机模型后,几乎挤不出多余空间给 KV 缓存。如果在 4090 上改用 INT4 格式,模型权重约 14–16GB,单卡只剩 8–10GB 显存供 KV 缓存使用,只要上下文拉长或并发稍高就会用尽。如果改用 FP8 格式,模型权重达到 27–28GB,单张 24GB 显卡连模型都装不下,必须凑至少 2 张卡提供 48GB 显存才跑得起来。
显存小在多卡场景下会放大成另一个问题:同样要凑出大显存,4090 得插更多卡。96GB 总显存,5090 三张就到,4090 要四张。卡一多,成本上去,还容易撞上非标准的张量并行切分:插 3 张 4090(72GB)会碰到 TP=3 的切分限制,部分显存闲置;插 4 张(96GB)本来是 70B 以上模型的配置,拿来跑 27B 纯属浪费。反过来,27B 用 INT4 其实单张 4090 就装得下,但剩下给 KV 缓存的只有 8–10GB,长上下文和并发一上来就见底。所以双卡 4090 顶多算跑 27B 的勉强下限,带宽打折和量化质量变差这两样还是绕不开。
更不用说现在的市场行情了。RTX 4090 已经全面停产,虽然 2022 年发售时的官方指导价 MSRP 是 $1,599,但在 2026-08 的市场上,全新 4090 售价上涨到了约 $2,755,二手市场交易价格也在 $2,200–2,350 区间。花比 5090 还要贵的溢价,去买一张显存更小、带宽更低、还不支持现代浮点量化的停产老卡,无论从技术还是账面上看都非常吃亏。
工作站级别的 RTX PRO 6000 Blackwell 配备了 96GB GDDR7 ECC 显存,直觉上可能让人觉得它推理更强,但在 27B 模型的自托管场景里,性能和成本完全倒挂。PRO 6000 的显存带宽是 1792 GB/s,和官方指导价约 $2,000 的 RTX 5090 完全一致。自回归解码的核心瓶颈全在显存读取带宽上,在带宽相同的前提下,PRO 6000 无法为单流解码带来任何加速。96GB 大显存的核心价值在于提供更大的 KV 缓存池:在 27B 模型的 FP8 模式下,模型权重占用约 28GB 显存,剩余约 65GB 显存可以全部分配给 KV 缓存池。但这种超大缓存池只有在超大并发搭配超长上下文的极端工况下才用得上,对个人日常开发或者小团队推理来说纯属资源过剩。
价格更是高得离谱。Tom’s Hardware 统计数据显示,PRO 6000 的零售价格从 2025 年 3 月发售时的 $8,565,上调至 2026 年 6 月的 $13,250,并在 2026 年 8 月攀升至 $16,000,累计涨幅达到 87%;Newegg 平台的实际零售挂牌价亦处于 $12,099 高位。付出 8 倍于 5090 官方指导价的采购预算,在 27B 推理上根本换不来等比例的速度提升。
多卡互联同样受限于 PCIe Gen5 P2P,单向通信带宽约 55 GB/s。而且它在固件上还有个让人头疼的问题。NVIDIA 开发者论坛 365739 帖子集中记录了大量固件崩溃报告:在 24×7 持续运行 vLLM 推理服务的环境中,设备在稳定运行数月后会突发整卡重置,系统内核抛出与 GSP 固件相关的 Xid 62、119、120、154 错误。该问题广泛存在于 570、580、595 等多个驱动版本分支中。发生故障后只能通过机箱 PSU 物理断电重启恢复,截至 2026-08-24 官方尚未发布修复补丁。对于追求 24×7 高可用性的自托管节点而言,这一固件隐患构成了直接的运维阻碍。
如果不打算自行采购并维护物理硬件,直接去云端租算力,主要有三条路:公有云 GPU 租赁、Google Cloud TPU 以及 AWS Neuron 专用算力实例。但这几条路径在实际算账时,账单与供给端都存在不少错位。
先看最常见的云 GPU 租赁:根据 2026-05 的市场行情,第三方算力平台(如 Vast、Spheron、RunPod)提供的 RTX 5090 租金约为 $0.51–0.99/小时(Spheron 挂牌价 $0.76/小时,RunPod 挂牌价 $0.99/小时),但现货算力库存长期紧张。企业级算力平台上,Lambda 提供的 PCIe 版 H100 按需价格为 $3.29/小时,SXM 版 H100 为 $4.29/小时(全市场价格处于 $2.19–4.29/小时区间),A6000 48GB 价格为 $1.09/小时。折算为 24×7 全月不间断运行,单张 5090 实例的月度支出约 $370–715,单张 H100 实例的月度支出达到 $2,300–3,100。更尴尬的是算力供给错位:2026-08 翻看 Lambda 等主流 AI 云平台的自助实例控制台,上面仅提供 B200($6.99)、H100 SXM($4.29)、A100($1.99)及 A6000($1.09)等企业级算力,并未提供 5090 或 PRO 6000 这类兼具高带宽与合理单价的消费级或工作站显卡自助实例。你在主流云平台上,根本租不到与本地同等性价比的硬件组合。
Google Cloud TPU 也是一条路,但硬件同样不对外零售。TPU v1 至 v7 芯片历来不对个人开放;虽然 2026 年 Google 首次开放硬件直售渠道,通过 Broadcom 面向 Anthropic 单独供应了 40 万颗 TPUv7 芯片(涉及金额约 100 亿美元,预计 2027 年上线交付),但普通开发者与企业只能通过云端租赁使用。TPU v5e 的官方按需租金为 $1.20/chip-hr,1 年期预留承诺价为 $0.84,3 年期预留承诺价为 $0.54,spot 竞价实例实测价格为 $0.5779。租用一套包含 4 颗芯片的 v5e-4 实例(提供 64GB 显存),按需月度账单达到 $3,504,1 年期预留月度账单约为 $2,453。软件支持方面,vLLM 官方 TPU 后端 对 9B–32B 标准稠密模型的支持已达到生产级别,但对 Qwen-3.8 所采用的 GDN 混合注意力架构支持状态尚未确认;SGLang 的 TPU 适配仅在独立的 sglang-jax 仓库中维护,且限定在 TPU v6e/v7 硬件架构上运行。
AWS Neuron 专用推理芯片同样仅以 EC2 实例形式对外出租。以 us-east-1 区域按需定价为例,配备 32GB 显存的 inf2.xlarge 实例 单价为 $0.7582/小时(折合月度约 $553),配备 192GB 显存的 inf2.24xlarge 实例单价为 $6.49/小时(折合月度约 $4,740)。框架支持上,vLLM 从 0.3.3 版本起通过 NxD Inference 提供了官方支持并声明兼容 V1 API,支持模型清单包含 Llama 2/3.1/3.3、Llama 4 及 Qwen 2.5/3,但 Qwen-3.8-27B 的 GDN 混合架构适配尚未经过官方验证;SGLang 官方没有推出 Neuron 后端,仅有第三方社区维护的 mini-sglang-neuron。真正上手时,Neuron 首次加载 15GB 模型需要约 15 分钟的 AOT 前置编译;Reddit 的 r/aws 版块自 2024 年 5 月起持续出现部署复杂度高与运行崩溃的反馈;AWS 免费套餐账户默认未开放创建 inf2 实例的权限。
公有云的核心优势在于为波动性业务提供弹性缓冲。但面对 24×7 恒定连续的高负载推理场景,云端 GPU 实例的月度账单开销是本地物理机电费支出的 6 倍至 50 倍。
算清自建和租云哪个更划算,关键看使用率。把硬件采购成本摊销、折旧与实际电费汇总,对比按小时计费的公有云租金,自建硬件与按需租赁的成本分界线落在月度负载占用率 26%–45% 区间(即每月实际高负载运行 192–328 小时)。月度使用率高于该区间,自建物理机能有效拉低单 token 推理成本;负载低于该区间,采用按需租赁或直接调用商业 API 资金效率更优。
在我的实际日常工作流中,推理服务保持 24×7 全天候常驻,单日处理约 2.24 亿 prefill token、新生成约 225 万 decode token,真正高负载运转的时间一天约 3.8 小时。按纯成本算,这个负载其实低于自建划算的门槛;但我选择自购 2×5090,图的是完全掌控推理栈,而不是成本。但对于多数独立开发者与中小研发团队,日常调用呈现典型的脉冲式特征:工作时段集中调用,夜间与周末处于静默状态,各项目周期交替期间机器长期空转,真实硬件使用率通常低于 30%。如果在低使用率场景下购置 24×7 自建节点,硬件折旧与基础待机电费将转变为长期的闲置浪费。
所以别急着下单买硬件,先测测自己的实际用量。可以在既有开发环境或测试节点中拉起 SGLang 服务,通过暴露的 /metrics 端点进行为期 7–14 天的连续监控,采集稳态 TTFT 延迟、KV 缓存分配比例、前缀缓存命中率以及并发排队深度等核心指标。依据真实业务指标计算实际负载占用率与峰值并发规模,再结合硬件矩阵做出选型决策,避免硬件配置与真实业务需求发生偏离。
回到开篇的成本账本:本地自托管一天 3.8 小时负载的月度电费约 $11,比商业订阅套餐的 $30 还低,纯粹从账面开销看自托管已经占优。那为什么还要投入精力自建服务?技术交流群中一位朋友给出了贴切的比喻:“现在超市买的鱼又好又便宜,但为什么还有这么多人去钓鱼?他不是为了吃鱼,他是享受这个过程。”自托管的逻辑同样在此:我要的是数据全程留在本地物理介质上的合规与隐私保障、脱离第三方服务内容策略限制的自由度、全参数微调与动态 LoRA 权重的完整控制权、断网脱机工况下的可靠运行能力,以及由自己完全掌控的全栈推理环境。在涉及核心隐私数据、定制化 Agent 行为以及高安全隔离要求的工作流中,这些特性构成了自托管的核心价值。
针对 27B 级别小模型的部署选型,可以遵循三步决策框架:
面向 27B 级别小模型的自托管实践,技术选型已经清晰:5090 双卡互联、NVFP4 浮点量化、SGLang 优化构建,结合真实负载指标评估使用率,并接纳够用即好的性能边界。自托管买下的是一套独立完整的控制权,而 5090 双卡在这个体量的模型上提供了扎实充裕的算力底座。
本文由Qwen-3.8-27B调研与构思,Gemini 3.7 Flash成文
Qwen-3.8-27B 采用 GDN 混合注意力架构(线性注意力机制),对显存占用和注意力计算开销比较友好。NVFP4 4-bit 浮点量化权重总体积 20.14GB,TP=2 双卡张量并行后每卡只占 11.02GB。推理引擎是 SGLang 的本地 vendor 构建,带 DFlash2 量化 lm_head 选择器。这套配置下 KV 缓存池 706,621 tokens,最大上下文 262,144 tokens,单流 decode 282 tok/s(单卡基准 256 tok/s,卡间 PCIe 互联没有拖累 decode),DFlash2 投机解码 accept 长度稳定在 5.2–5.4。
稳态指标(生产日志,约 24 小时窗口):首次冷启动 TTFT 约 78 秒(JIT 编译),之后降到约 0.2 秒;decode 吞吐中位数 183 tok/s、峰值 664 tok/s;前缀缓存命中率全天 96%、实时 gauge 99.3%。一天的 token 账:prefill 输入约 2.24 亿 tokens,其中 1.82 亿命中前缀缓存(真实计算量约 4,250 万);decode 输出约 225 万 tokens。负载形态是 agent 在需要时发起请求,不是 24 小时连续出 token;decode 活跃时间约 3.8 小时,其余时间机器基本空闲。
采样参数:temperature=1.0、top_p=0.95、top_k=20,enable_thinking=false 关闭内置思考。上游模型是 DeepSeek Flash V4(Ollama Cloud 托管,非本地);盲测场景下这个 27B 的综合逻辑与生成水平和它处于同一梯队。