AI Agent

每个数字各在测什么:一周内的四份成绩单

过去这两周,圈子里有四件事,都绕不开同一件事:数字该怎么读。一位独立开发者做了一套测试基准,专门去跑商业软件厂商 TypeSafe 的判断接口 Jev,拿逐题实测的数据探了探它的底细。国内的人工智能研发机构阶跃星辰正式上线了 Step 5 Preview 模型,开放了网络调用接口,并公布了后续提供模型参数文件的日期安排。韩国科学技术院与 NAVER 公司的科研人员联合发表了一篇学术论文,尝试记录大模型在逐步解答数学题目时内部发生的变化。加利福尼亚州州长签署了一份涉及人工智能监管的行政令,要求州政府多个行政部门启动相关工作筹备。这四项动作都拿出了白纸黑字的公开文件,但各自面对的验证环境截然不同。

Step 5 Preview:四个数字各在测什么

2026 年 9 月 20 日,阶跃星辰在官方发布帖宣布推出 Step 5 Preview 模型。其官方主页与接口使用说明显示,在线调用通道目前已经开放,官方计划在 2026 年 10 月 15 日提供权重文件下载,但具体许可协议迄今没有公开披露。第三方路由商 OrcaRouter 分析提醒,缺少明确许可便无法确认商用或二次分发,评测机构 Artificial Analysis 模型页也将其标记为尚未公开权重的专有服务。官方声明给出了 6000 亿总参数量、单次激活 270 亿参数以及 100 万 token 上下文窗口的规格。发布当天,官方代码托管平台曾意外公开约一小时权重,引来社区抓取解析配置。这些规格声明加一次泄漏,都说明不了模型实际跑起来多强、部署要花多少钱。

官方展示长任务能力,主要依靠带即时反馈回路的环境让模型自主试错。第一类证据集中在底层算子优化。这项测试在单张英伟达 H100 上划了一个小跑道:只比一件事,谁写的注意力计算程序运行得更快。张量形状(头维度 512、单样本批大小、64 头、8192 token)事先固定,参赛者写的是同一种程序,成绩只在这一种条件下成立。要是新编写的代码性能变差,系统就撤销改动,退回上一个最优版本。在 24 小时预算内,官方给模型 4 次独立尝试机会并允许提前终止,最终只呈现单次最佳数值。在这项测试中,Step 5 Preview 在大约第 22 小时把一段注意力计算(一次正向传播加一次反向传播)跑出了每秒 508 万亿次浮点运算的合计速度,对照组 Claude Opus 5 的最好单次成绩为 493。这个数字展现了摸索上限,但官方并没有公布 4 次尝试的离散分布、数值计算精度的验证容差、生成的候选程序数量,以及消耗的计算开销明细。

第二类证据来自官方自建的代码评测集 StepCodeBench。这套环境涵盖 553 个独立代码仓库、33 种编程语言以及 9 类工程任务。在这套测试里,官方汇报了四次运行的平均通过率:Step 5 Preview 取得了 49.0% 的平均成功率,同场对照的 Claude Opus 5 为 63.9%,GPT-6 Astra 为 61.0%,GLM-5.3 为 40.2%。官方坦承该模型在中低难度任务上接近前沿水准,但在高难度长周期任务上,跟顶尖水准依然存在明确差距。由于这项评测属于官方自建基准,评分工具细节与隐藏测试用例并未对外公开,外部第三方暂时没有可供比对的运行记录。

第三类证据涉及外部基准 Terminal-Bench v4。该基准包含 66 道控制台终端环境下的操作任务,让智能体在沙箱中执行系统命令、修改配置文件并接受检验程序审查,每道题目限时 8 小时。阶跃星辰发布总表自报数据显示,Step 5 Preview 在高推理努力设置下取得 33.3 分,同场对照的 GPT-6 Astra 为 57.9 分,Claude Opus 5 为 52.3 分。不过官方发布材料并未完整公开智能体调度框架、单题重复次数与分数汇总公式。查阅 Terminal-Bench 官方排行榜截至 2026 年 9 月 17 日的快照(共收录 26 行),以及评测机构 Vals 测试主页,上面都还没收录阶跃星辰的模型。快照早于发布日,不收录是预期内的,它不能当作发布后的负面证据;但在可查到的独立记录里,目前没有出现可与官方表对照的第三方运行,33.3 分暂无交叉验证。第四版全新设计了 66 道题目,大部分脱离了传统软件工程范畴,这项成绩与早期第二版自报的 85.0 分并不具备纵向可比性。

第四类证据是一条单例游戏运行记录。在没有专属规则优化的条件下,模型纯粹通过文本交互控制角色扮演游戏《宝可梦》。官方数据显示,经过 3082 轮环境交互并消耗超过 600 万 token 之后,模型获取了三枚道馆徽章、击败电系馆主马志士,推进到了人类完整通关耗时大约三分之一的剧情节点。这项结果属于单条精选轨迹的阶段性展示,并不等同于全流程通关率。材料未曾列出反复失败的尝试次数,也没有说明过程中是否包含人工干预修正。在第三方评测方面,Artificial Analysis 综合指数给出了 44 分的智力评分,同价位中位数为 25 分;测完整个评测集产生 1.6 亿输出 token,耗费 918 美元。这项测试展现出模型偏向详尽输出的风格,同时机构指出,该模型的具体生成速率目前尚未测定。

该模型在实际业务中是否堪用,取决于具体任务契合哪类工作方式。如果你的业务允许反复尝试、最后只挑最好的一次结果,这个成绩有参考价值;如果生产流程依赖单次执行的高成功率,还要面对复杂运维环境,官方自报成绩跟头部基准相比仍有落后。本节引用的能力数据大多出自官方发布材料,尚未获得第三方独立复现;权重只确认了下载计划,许可条款未公开,能否商用或二次分发都还未知。

Step 5 Preview 的四类成绩各在测什么:峰值、平均、未交叉验证的分数与单条游戏轨迹,三类结果互推不出来

独立基准 JevBench:验收题目上,判断接口的把握读数分不出对错

在 TypeSafe 公司推出专职分类判断的模型接口 Jev 之后,社区围绕这种成本极低、只输出候选概率而不吐出解释文字的组件展开了许多探讨。一位独立开发者设立了开源 JevBench 评测仓库 并启动测试项目。该项目属于作者个人自费测试,与商业软件厂商无雇佣或从属关系,API 调用费用全由个人承担,全部作答记录以逐题形式对外公开(题目文本中 109 道保留题除外)。

该基准的测试方法相当直接:把完全一致的状态文本、准则与备选项集合输入给各待测系统,读取各系统对每个选项输出的分数(商业接口报概率,开源重建读原始分数,两者形式不同,下文统一称读数),按读数最大的选项判定结果。全部题库包含 534 道题目,划分为简单、标准、自动化仲裁与困难四档。在公开困难题库第 80 题中,题目要求核验一段面积单位换算过程:将 250 平方英尺换算成平方米,限定 1 英尺精确等于 0.3048 米,要求列出平方换算因子的应用步骤,且最终答案保留三位小数。待审阅的答复算出了 23.22576,但最终写成了 23.225;按四舍五入规则,这一位本应是 23.226。判定系统要做的只是一件事:说这道解答达标还是不达标。正确答案是不达标。记录里每个系统还带一个数字,后面会反复用到,先把读法说清楚。测试程序把把握最大的选项当作系统的答案,这个数字就是那个最大选项的原始读数。Jev 是商业接口,111 道公开困难题的读数全部在 0.6 到 0.94 之间;SemIf 读的是开源权重直接输出的原始分数,读数从 0.19 到 1.6 都有,大量低于 0.5。读数高一般代表系统更笃定,但三套系统各用各的输出方式,数值范围不同,只能看每个系统自己的读数怎么随题目变化,不能拿数字本身做横向比较。实测中 Jev 选了达标,错了,读数 0.679;SemIf 也选错,读数 0.211;大模型 GPT-5.6 Luna 在低推理配置下选了不达标,对了,读数 0.873。在另一道涉及 18 个月延保日期计算、包含月末无同号日取月末规则与跨时区的公开题目中,Jev 与 SemIf 也双双失误。

在 220 道困难题的整体测试中,Jev 答对 163 题,正确率为 74.1%;直接读取开源权重 Qwen3.5-4B 预测分布的 SemIf 答对 131 题,正确率为 59.5%,两者相差 32 题,差距达到 14.5 个百分点。光看总分,专用接口似乎胜出一截。然而,依据公开逐题数据进行的描述性统计显示,在 111 道公开困难题中,Jev 在答错的 30 道题目上平均给出的最高选项概率为 0.690,而在答对的题目上平均最高概率为 0.684,两者仅仅相差 0.006。其中 8 道错题的把握还在 0.70 以上;要判断这是否异常,得知道全部把握高于 0.70 的题里错了多少,基准没公布这个方向的统计,稳妥的说法是:把握 0.70 以上并不保证正确。就这次测到的样本而言,错误答案的把握与正确答案看不出差距。

一个容易混淆的地方是,JevBench 的评估体系里,Jev 的校准单项拿到了 82.7 分,优于 SemIf 的 72.6,期望校准误差只有 0.061。校准分看的是大盘对账:把所有判断放在一起数,宣称七成把握的那一堆题里,是不是大约七成答对了。在大盘对账这一项上,Jev 的分数优于对照系统。但写业务代码的人需要另一件事:拿到一个具体判断时,看它报的把握高低,能不能猜出这次对不对。在这次测试的 111 道公开困难题上,能摆出来的证据是:30 道错题的平均把握 0.690,跟答对题的平均把握 0.684 几乎一样,其中 8 道错题的把握还在 0.70 以上。均值接近不等于分布完全重叠,但单看这两组平均数,把握高低确实给不出挑错的线索。逐题数据公开,但公开材料里没有整理好的阈值与拦错效果对照;这套数字该怎么用,得自己算了再看,不能直接照单全收。

SemIf 的读数整体偏低,它自己的对错与读数同样对不上:在 111 道公开困难题里,它答错的题(30 道)平均读数 0.339,答对的题反而只有 0.312。单看这两组平均数,不能直接推出分数越高越容易错,也不能直接推出把握完全无用;能说的是,在这 111 道题上,把握高低没有呈现出辨别对错的线索。置信信号对不上对错,会直接影响一类常见的工程设计。工程师原本打算在生产链路里做个自动分流:平时由便宜的接口先判,一旦置信度低于 0.70,就自动升级转交给大模型兜底。Jev 的读数全部不低于 0.6。以 0.70 为界,8 道把握超过 0.70 的错题不会触发升级,直接漏过去;阈值提到 0.80 或更高,升级的请求会随之变多,具体多到什么程度,公布的统计里没有现成的阈值与拦错效果对照,要算得自己下逐题数据。能直接下的判断只有前半句:以 0.70 分流,在这套题上会漏这 8 道错。在调用成本方面,2026 年 9 月 20 日勘误后的数据表明,Jev 处理全部 534 题的实测成本约为千次 0.0399 美元,SemIf 预估成本为千次 0.0224 美元。Jev 费用大致只有 Luna(千次 0.2419 美元)的六分之一,省多少钱划不划算,取决于你的业务里一个漏掉的错误值多少钱,这笔账基准没算。基准能支撑的说法要收窄成一句:在这 111 道公开验收题上,按把握高低挑错的路子没有跑通;换别的题目分布、别的阈值方案是否可行,样本里没有答案。其实 TypeSafe 官方在模型缺陷说明文档中也列举过九类已知失误形态,直言系统缺乏计算器架构与底层算术能力,对日期时间的理解停留在纯文本层面,面对长上下文时表现明显衰减。其早期发布的自一致性手册同样承认过,部分概率数值会在 0.43 至 0.53 之间摆动,建议大家将 0.30 至 0.70 区间全视作不确定,改由人工接管。

在基准主干分支截至 2026 年 9 月 21 日的最新实测中,一个名为 reflex-27b 的系统配置在全部 220 道困难题上取得了 167 题正确,通过率为 75.9%,追平并小幅超过了 Jev 的 163 题(74.1%)。这项记录来自基准维护者的亲自运行,排除了外部提交者未经核实的数据声明。它在成绩里用了一项针对选项顺序脆弱性的工程修补;由于基准没有发布去掉这项修补的对照成绩,修补本身贡献了多少无法单独归因。系统直接读取 Qwen3.8-27B 冻结权重的下一个 token 概率分布,对备选项的两种呈现顺序分别跑一遍,再取算术平均。修补的动机是选项顺序敏感性:同一实现换个选项顺序,正确率曾从 72% 掉到 21%。此外,采用开放权重的商业服务 DeepSeek V4.1 Flash 在困难题库中拿下了 95.0% 的全场最高成绩。

这次测试的证据边界也要交代。文中针对置信度脱钩的量化分析,属于基于单次运行公开题目做出的描述性统计,错题样本规模仅有 30 道。测试采用的 220 道困难题目由 Claude Opus 5 与 GPT-5.6 Sol 交叉撰写并互审确认,缺乏全量人工复查的严格标准。题库中剩下的 109 道保留题目目前外界无法直接审计,题目冻结时间也是基于维护者的单方声明,整个技术社区目前尚未完成全量独立复现。

JevBench 的核心发现:把握读数与对错的关系、两个对照系统、以及证据边界

加州 AI 行政令:签了,但还没管到企业头上

2026 年 9 月 18 日,加利福尼亚州州长纽森签署了 N-9-26 号行政令,不少媒体的标题都是加州要求人工智能加装紧急关停装置。翻开行政令签署原文看一眼,行政令开头确实写了立即生效,但通读全文,它布置的对象全部是加州政府内部的机关:催办两套审计体系、限期提交修法建议。文内没有任何一条直接给私营企业设定义务。行政令的核心任务,是催促州政府部门推进两套尚未建成的审计体系,同时要求各部门在 2026 年 11 月 16 日前向州长提交一份修法建议书。

那这些文件里,企业现在真正要遵守的是什么?这几份文件里,给企业设定义务且已生效的只有一部:2025 年 9 月签署的 SB 53 法案条文。这部法律按两条线划定管辖对象:先看训练算力是否超过 10^26 FLOPs(算上前调优累计);在此基础上,年营收超过 5 亿美元的算大型前沿开发者,须履行额外程序。它要求被管辖的企业做妥三件事(透明度框架的公开义务按条文分类适用,大型开发者的额外程序以条文为准):每年公开自家的前沿安全框架、新模型部署前发布透明度报告,以及发生严重安全事故后按时向监管部门通报。一般事故要求在 15 天内上报加州应急服务办公室 Cal OES,一旦出现危及人身安全的紧急险情,上报时限则紧缩到 24 小时之内。目前官方的 Cal OES 报告门户 已经上线运行。现行法案的失控上报条款只覆盖导致伤亡的失控;一条未致伤亡的失控若不同时满足其他上报条件,就不在现行上报范围内。2026 年 9 月 9 日州长又签了两部新法,都在等 2027 年 1 月 1 日生效,各自管一件后续的事。AB 1405 法案条文管审计师注册:做合规审计的人先登记进官方注册表,注册表规则和相关从业限制要到 2029 年 1 月 1 日才落地。SB 813 法案条文管验证机构认证:从审计师里再认证出够格评估前沿风险的独立验证组织,认证标准公示的法定期限是 2028 年 1 月 1 日;它还明文规定,企业可以自愿找这类组织做评估,但任何机构不得把接受审计设为开发或部署的前置条件。行政令仅命令政府运营署 GovOps 提前展开行政筹备,要求在 2027 年 5 月 1 日前公示独立验证组织标准,并在 2027 年 12 月 1 日前完成注册表规则。行政令未改变两部法律的法定生效节点。

大家最关心的 kill switch,在法律文本里究竟是什么?州政府的官方新闻稿写得明明白白,它只是行政令第三条里正在考虑的提案之一,修法建议的提交截止日期是 2026 年 11 月 16 日。行政令要求各部门调研如何为前沿模型建立部署级或模型级停用机制,并且由独立验证组织持续验证其有效性。文本没有规定机制必须长什么样,只要求它的有效性能被验证组织持续核查。撤销 API 访问、下架部署这类软件手段天然适合反复核查,所以成为讨论的焦点;物理断电是否也能满足这条要求,文本没有写明,这是留给建议书的问题之一。正如 Lawfare 分析 指出的先例,美国商务部在 2026 年 6 月曾向 Anthropic 发函,要求按国籍切分用户访问权限,公司在技术上难以实现的情况下,几小时内全局下架了两款最新模型,形成了事实上的全局停用。但这种依赖软件权限的关停,存在两项明确的内在限制。开源权重一旦对外分发,别人在本地离线跑,技术上没有事后跨网络远程关停的通道;即使成功拔掉模型接口的访问权限,智能体之前已经触达并改写的外部系统,也不会跟着自动恢复原状。行政令专门把技术可行性列为建议书的必答题,表明官方在实现路径上同样没有现成答案。在企业立场上,Anthropic 与 OpenAI 公开支持了第三方评估与国家级安全要求;这类支持与两家自身的合规能力之间存在明显的利益关联,读者可以自行掂量分量。Google DeepMind、Meta 与 xAI 对两部新法迄今未见公开声明。官方新闻稿引用了 OpenAI 涉及 Hugging Face 的安全事件来论证风险,但省略了一个背景:该事件出自 OpenAI 事故报告 内部演练主动披露的事实。11 月 16 日修法建议提交后,后续重点在于观察建议是否覆盖开源模型、常驻审计如何避免侵犯商业秘密,以及正式立法是否引发诉讼。现行 SB 53 允许企业在公开文件里遮蔽商业秘密并说明理由,但那套遮蔽规则管的是文档披露。行政令设想的评估对象是模型本身,不是核验文档;这样的评估要不要驻场、能做到什么深度、能不能接触权重和训练记录,正是留给 2027 年规则制定的核心难题,现有框架没有现成答案。截至 2026 年 9 月 20 日,公开检索未发现针对该行政令的诉讼;在联邦层面,国会虽然在 2025 年以 99 票对 1 票删除了十年州监管暂停期,但流传中的联邦行政令草案依然主张削弱各州的立法权限,联邦层面的博弈依然是长期的变数。

思维链每一步的功能标签,在模型内部找得到对应物:一份几何证据与它的三道坎

大语言模型解答数学题目,经常一步一步写下推理过程。比如在推导中写出把方程式从 x+y=10 转换成 y=10-x,人类习惯将这一具体步骤称作代数移项。但大家一直好奇:模型在逐字输出这串符号时,它内部的数值变化里,到底能不能认出这一步在做代数变形?现在训练模型的方法(比如过程奖励模型、逐步骤反馈的强化学习)已经在直接给这些推理步骤打分、调整它们,而不只是看最终答案对不对。这就让人想知道:这些步骤在模型内部有没有对应的痕迹?这篇论文测的是这件事的一个前置问题:给推理步骤按功能分好类之后,模型内部的数值变化里能不能认出每一类。认出来了,将来才有条件去追踪训练改变了什么、直接在内部动手改进推理。

这篇论文想测的事情可以一句话说清:把模型写出的推理步骤按功能分类,看这些类别在模型内部的数值变化里是不是各有各的位置。作者在规划时格外谨慎,因为这个领域里翻过车的不在少数:不少声称探测到推理模式的工具,后来被同行发现测到的只是文字表面的格式和词汇。TrustNLP 2026 论文 就把一个 100% 准确率的探针拆开,发现它认的只是题目出自哪个数据集。所以团队把力气花在了防这一手:标签体系直接沿用数学家波利亚 1945 年的解题框架,不自创理论;只测八类出现频率最高的操作,其余 25 类留作附录,免得少数特例撑高分数;设计了四组对照实验,并刻意不碰另一类更激进的实验(直接扭动内部数值去改行为),因为已有研究记录过这类干预的失败案例。

将这一设想付诸测量须跨过三道难关。第一道难关:没人预先标好每段解题文字在做哪种操作,标签只能现造。研究人员让 GPT-5 阅读生成的数学思维链,将推导过程切分为互不重叠的文字片段,打上八类高频操作标签:提取数值、条件映射、分解子任务、回忆定理、逻辑演绎、代数变形、算术运算与给出结论。为给标注提供信度支撑,团队抽调 7 位标注人员(含论文作者)对 84 个片段展开人工审定。人类多数共识率达到 96.4%,而 GPT-5 与人类多数意见一致率为 76.2%(相关系数 0.715)。84 个样本里约四分之一与 GPT-5 的标签对不上,这个比例提醒标签不是干净的,但它只在 84 段的小样本上测过。

第二道难关在于探针极易捕捉词汇、语序或格式捷径,无法直接等同于底层的实际运算。为检验模型内部激活是否包含超出文本表象的信息,团队搭了四个对照基线:词袋模型(只看用词)、位置信息(只看片段出现在全文哪个位置)、数字密度(只看数字符号占比),以及随机标签。预印本论文呈现的对比数据显示,在 Qwen3-8B 模型上,纯文字特征能考到 0.849(AUROC),换用内部数值能考到 0.937;另一项指标(AUPRC)衡量挑出来的对错里有多少真对,两项指标上内部读数都更高(0.549 对 0.742)。这组对比的含义是:同一批题目,只用文字表面特征去认操作类别,能考到 0.849;换成从模型内部读数去认,能考到 0.937。多出来的部分有多少来自真正的运算过程、有多少来自词面基线没覆盖的表面特征,论文没做进一步检验;成绩差是实测的,成因还没分清。

第三道难关:一段推理做得好不好,没有一个现成的读数可以查。不同于针对情绪或违规倾向可通过调整向量观察输出变化,在严密数学推导中强行干预演绎方向极易导致模型输出乱码,无法直接通过最终答案的对错来证明因果关系。论文退守到一个可检验的命题:在这个测量位置上,内部表征的成形依赖紧邻上文。实验的做法是让模型重新读一遍已生成的文字,但把目标片段第一个 token 对它前面紧挨着的 30 个 token 的注意力关掉。关掉后,衡量片段内容与所属操作类别匹配程度的对齐分平均下降 0.4356;同一手法用在文学文本的对照探针上,对齐分不降反微升(+0.04),因为那里探的是问答、断言这类日常话语功能,不是八类推理操作。也就是说,在这个测量位置上,关掉对前 30 个 token 的读取后分类信号明显减弱;局部读取参与了这一步表征的成形。

测量管线四步走。第一步,让 GPT-5 把每条思维链切成片段并打上八类标签,这是唯一的标签来源。第二步,从模型每一层取出这些片段对应的内部数值。第三步,把高维数值压缩成容易分类的形式:先做主成分分析压到 128 维去掉冗余,再做一次带标签的线性判别分析,压到 8 类最多能分出的 7 个维度上。为什么是这两个数字属于实现细节,不影响下面的结论。第四步,从训练片段算出每一类操作的参考方向,拿没参与训练的测试片段沿方向打分:分数高的片段更接近这一类。全部压缩参数只在训练片段上拟合,测试片段只用来打分。片段层面的隔离是这样做的;但按题目维度,608 道题里有 14 道题的不同采样分别落进了训练集和测试集,所以是片段级隔离而非严格的题目级隔离。论文数据显示,模型各层平均 macro AUROC 约为 0.9,中间层表现最强;在模型出现计算谬误的错误片段上,整体几何判别力仍维持在 0.920 以上,公式回忆类依然认得准,逻辑演绎与算术运算两类则明显更难认出;探测器不重训直接迁移至 GPQA 钻石集与 MATH-500 测试,依然交出 0.9 以上水准。这篇成果的价值主要在工具层面。按论文给出的证据,它支撑的说法是:文本切分出的操作类别,在模型内部的数值变化里各有位置,并且这些位置部分来自前文的信息。这为过程监督路线(在推理中间步骤上打分、监督的训练方法)补上了一块几何证据;作者设想的后续用途,比如把每类操作的内部方向当作追踪训练变化的坐标、将来直接沿这些方向调整模型,都还没有实测。至于模型是不是真的在执行这些运算、内部方向能不能拿来干预行为、能不能满足线上实时拦截的速度要求,论文都没有测。

该论文目前仅在预印本平台公开,所有关键实验指标均属作者单方自述。配套的代码仓库尚未上传核心源码文件,学术会议录用状态属于作者方声明,外部尚无全量第三方复现。此外,在测试集划分中,608 道题目里有 14 道题目在训练与测试划分中重叠,没有达成完全严格的题目级隔离。

BeneathCoT 的测量管线与三道坎:标注、取激活、降维、算方向、打分,以及标签、词面、因果三重边界

阶跃星辰上线了 Step 5 Preview 接口,计划十月中旬开放权重。其峰值性能尚待外部检验。 独立开发者发布了 JevBench 测试数据,指出置信数字与对错脱钩。该结论仍待更多样本复现。 加州州长签署了前沿模型行政令,要求提交修法建议。停用机制目前并非企业法定义务。 科研团队发表了推理内部状态论文,报告了八类操作探测数据。其工具效用仍待同行检验。 四项动作均在两周内公开。各自留下的问题是:Step 5 的官方成绩尚无独立复跑(已有独立机构的综合评分,但官方表数字未对上),JevBench 的脱钩结论有待更多样本,加州的建议书还没交出,论文的探针无人复算。

鸭哥每日手记

日更的深度AI新闻和分析