AI Agent推理与性能

智能体 token 用量过线人类、OpenAI 自研芯片跑分出炉、GitHub 发布文档压缩原型

智能体 token 用量过线人类、OpenAI 自研芯片跑分出炉、GitHub 发布文档压缩原型

先看上周 AI 行业的三条新闻。OpenRouter 平台公布了一组数据,智能体消耗的 token 数量超过了人类,差距还在拉大。接着 OpenAI 放出了自研推理芯片 Jalapeño 的首批跑分,部分指标跑赢了 Nvidia 现役产品。另外 GitHub 前瞻团队发布了 Knowledge Compressor 原型工具,可以把智能体反复阅读的文档压短一半。这三件事各自带着数字上的坑,我们挨个说。顺带一提,这三笔账里都有一个关键角色。模型服务商对重复读取的上下文会给个折扣价,这套机制叫 prompt caching,我们先放一放。

三份不同的账连向同一枚打折硬币:名义数字都因缓存折扣而失真

智能体 token 用量达人类 5.2 倍,实际账单约 2 倍

8 月中旬 OpenRouter 平台数据负责人 Peter Walker 给了一组统计数据。2026 年 2 月 6 日是人类 token 消耗量最后一次赢过智能体。截至 8 月 10 日的七天平均数据显示,智能体每周跑掉 7.3 万亿 token,人类每周用掉 1.4 万亿 token。按这两个数字算,智能体的名义用量达到了人类的 5.2 倍。过去半年里智能体用量涨了 14 倍,人类只涨了 2.8 倍。这组数据传遍了 The Decoder 和 a16z 等五个独立转述链,各家引用的数字都对得上。这组多方核对一致的数据构成了判断近期 token 经济的基准

这 5.2 倍的用量其实有两个口径。按 Walker 自己给的 total token usage 来看,智能体用量里差不多 70% 是缓存读取;a16z 周报转述时换了 token burn 口径,占比在 85% 以上。两个口径统计的不是同一种量,分别是约 70% 和 85% 以上。a16z 也点出,智能体多出来的那些用量基本都是缓存 token 贡献的。模型服务商对缓存的收费一般要低很多。按这个缓存占比加上缓存约一折计价粗算,智能体给人类打出的实际账单倍数在 2 倍上下。这个估算没有实测兜底,最终落在哪,还得看两边实际的缓存占比和具体的折扣费率。

用这组平台数据还得卡死两条外推边界。第一,这只是 OpenRouter 一家的数据。平台厂商自己说他们的流量只占全球推理量的 1% 左右,每周大概 28 万亿 token。这里的用户多是开发者,模型也偏向 token 效率偏低的开放权重。他们区分人类和智能体靠的是七个行为信号加权估计,权重没公开,别人没法复现。再加上八月份碰上假期,人类用量也会跟着往下走。更夸张的是单点集中,Hermes Agent 这个单一应用一周就烧了 1.5 万亿 token,快赶上其他 49 个追踪应用的加总了,差不多占了智能体总流量的两成。

第二,这个数字有系统性高估的倾向。转述案例里经常看到智能体去下载无关文件或者搜一堆没用的东西,更典型的是掉进重试风暴:第一次失败就该停手,它却一遍遍地重来,token 就这么滚上去了,干的活并没有变多。另外平台整体的缓存命中率确实高,但个别应用还是会遇到缓存失效,比如 hermes-agent 的 20957 号问题。这些坑连同动态提示词和缓存写入的单独计费,都在一点点吃掉账面上的省钱效应。

GitHub 压缩原型:官方称 2,000 次复用回本,中位预期 5,000 次以上

GitHub 前瞻团队研究员 Alex Gorischek 8 月 24 日发了个原型工具叫 Knowledge Compressor。这东西能把智能体反复读的知识文档自动压短。在官方示例里,合成文本从 996 个 token 压到了 480 个 token。它的做法是先自动生成二十四道问答题,然后闭卷筛选加迭代压缩。有个强制见红机制要求至少一道题答错,接着进入失败回流和最小恢复环节,直到全绿收工。官方博文中描述了这套验收流程。官方给算了一笔经济账,压缩一次花 2 美元,每次未缓存读取省 0.001 美元,同一份文档复用 2,000 次左右能回本。官方在脚注里认了回本门槛会受定价和缓存影响,但没给出具体数字。

这笔回本账有个错位。官方算账时把每次读取都当成未缓存的全价计费,可文档在多轮交互里反复加载,这正好是缓存命中的优势场景。把缓存折扣算进去,工具的经济收益就有点波动了。官方隐含的单价是每百万 token 1.94 美元,Sol 的牌价则是 4 到 5 美元。大头还是在缓存价格上,主流厂商的定价差得很多。OpenAI 和 Anthropic 的缓存读取按原价一折计,Gemini 按二五折计,DeepSeek 只收百分之二。一项实测数据表明,长会话缓存能省下 78% 到 81% 的成本。如果按 50% 缓存命中率算,回本大概要 3,640 次。按 90% 命中率算,回本大概要 10,500 次。要是全缓存的情况,回本门槛直接顶到 20,000 次。那 2,000 次只是全价情况下的乐观估计,诚实的回本区间落在 2,000 到 20,000 次之间,中位预期在 5,000 次以上。

我们再往 10K token 长度的文档推算一下。单做压缩就要花 20 美元,加上 240 题跑全新上下文的验证环节还得花 25 美元,跑一次起步成本就是 45 美元。这个原型现在没开源,外部复现和社区反馈都没做到官方演示的理想状态。另外拿问答指标来验证压缩效果也藏着坑,连接性知识丢了在指标上也看不出来。这个工具剩下的不可替代价值,只有上下文容量这一项。而且这个回本门槛还要求文档几乎不能改,每次还得把全文读进上下文。海量的业务文档在生命周期里,很难做到 5,000 次以上的无修改读取。

OpenAI 自研芯片跑分领先,但真实负载测试缺席

OpenAI 8 月 25 日交出了自研推理芯片 Jalapeño 的首批成绩。在 8,000 token 读入、1,000 token 产出的固定长度单轮测试中,他们用了 GPT-OSS 120B、DeepSeek R1 670B 还有开放权重的 Kimi K2.5 三款模型。对标 Nvidia 的 GB200 和 GB300 芯片,Jalapeño 的每瓦吞吐达到 1.5 到 1.9 倍,端到端延迟快了 1.7 到 3.6 倍。这组由厂商单方面提供的数字说明了新硬件的纸面性能。第三方评测机构 SemiAnalysis 在实验室现场抽检了一部分推理轮次,没有跑全套测试。现有的批评未质疑造假,都认可是真的领先,转而指出测试口径有缺失。

SemiAnalysis 更喜欢用模拟长上下文和多轮对话真实智能体负载的评测口径,比如 AgentX。在这个负载场景里,有个关键变量是重复读取相同的长篇前置上下文,也就是重前缀缓存。这次给出的所有成绩里,未见 AgentX 成绩。评测机构提了一句,在 8k/1k 固定长度打靶里跑得好的框架,到了真实的 AgentX 测试里表现经常不太行。单一的固定长度最优未必能代表复杂的智能体工作负载具有同等表现

技术社区 Hacker News 补充了两条不对称的测试口径批评。先是拿来参照的 Nvidia Rubin 成绩算上了投机解码技术 speculative decoding,Jalapeño 这边没用。再是 Jalapeño 现在还只是工程样品,2026 年底只有极小规模,要到 2027 年才开始放量,Rubin 可是已经实际出货了。而且这次直接对比的对象是 GB200 和 GB300,Rubin 没进直接测试环节,单用户解码场景对真实业务的代表性也比较弱。换到 per-total-cost 口径看,媒体 wallstengine 转述的观点是,Jalapeño 和 Rubin 水平差不多。仔细盘这第三本账,它和前面两本结构很像。8k/1k 固定长度测试测不出真实智能体负载,因为真实负载里占比最大的活儿,正好是享受折扣的重复内容读取。在这本账里,折扣读取直接让真实评测口径缺席了。

平台账单里名义与实际失衡,压缩工具的回本门槛一路抬升,芯片评测的真实负载成了移动靶

三件事放在一起看

三条新闻来自三个不挨着的发布方,看的时候各有一个要避开的坑。引用 OpenRouter 的用量数字,得记住大头都是打折的缓存读取,名义上是 5.2 倍,折算下来实际账单粗算约 2 倍。听压缩工具的省钱故事,先去核实它的回本账是按全价算还是按折扣价算。看芯片跑分,要留意打靶成绩和真实负载成绩现在是两码事。这些事背后其实都牵着 prompt caching 这个变量,我们六月那篇 KV Cache 文章聊过它的杠杆。这里不展开,大家心里有数就行。

鸭哥每日手记

日更的深度AI新闻和分析