做 agent 编排这一年多,我脑子里一直有个默认设定:模型是块焊死在电路板上的芯片。提示词怎么写、检索召回怎么调、工具给几样、上下文窗口塞多满,所有优化动作都发生在模型外面。闭源 API 占主导的阶段,这个设定符合工程现实。供应商把模型封装成黑盒,开发者能碰的只有外围管道。
最近读 Stanford 几个组合作的 AgentFlow 论文,这块铁板出现了一条缝。论文最吸睛的标语是 7B 模型打过 GPT-4o,但同一套编排系统里藏着另一组更关键的对照。在负责规划与工具调用的决策节点上,把冻结的 Qwen2.5-7B 换成 GPT-4o,平均只多 5.8 分;让 7B 决策节点从真实工具反馈里持续学习,平均多了 17.2 分。差距并不来自模型体积,一个在持续吸收反馈,另一个停在原地,这才是分水岭。
开放权重模型给系统架构提供了一个新选项:工作流里的决策节点,可以放回真实执行闭环里训练。这篇文章梳理我复盘这套思路的过程,说明它能够走通的边界,以及它在哪里必须停下来。
做 agent 系统的开发者最近多少都有体会:外部编排的红利在变薄。同一个任务,今天用 Claude Code,明天换 Codex,后天再试 DSH,来回折腾一圈后发现,顺手调调提示词和工具描述,差距往往就能抹平。继续堆上下文、加工具、精调检索,收益曲线越来越平缓。外部能换的工具都换过一圈,每一套里的模型依然是那块动不了的常量。
这个局面有它的商业逻辑。闭源 API 的交付形态天然是静态的:开发者按 token 付费租用黑盒,厂商在出厂前完成训练,调用方能干预的只有输入的组织形式。久而久之,模型不可变动从现实约束变成了系统设计的默认前提。很少有人再追问一句:决策逻辑只能靠外部规则硬编吗?
开放权重的演进在打破这个前提。Qwen、DeepSeek、GLM 这类模型的权重可以自由下载和调整,微调工具链也早已不属于少数科研机构。WebRL 是个更早的先例:Llama-3.1-8B 经过自演进训练,在 WebArena-Lite 上的成功率从 4.8% 提到 42.4%,超过了同期的 GPT-4o。用训练让小模型在特定场景追平在役大模型,此前已有验证。现在的分水岭在于改哪些部件、投入是否合算。AgentFlow 给出的解法,是把训练聚焦在工作流的决策节点上。
训练改的范围很窄。AgentFlow 包含四个功能模块:Planner 负责分解目标与挑选工具,也就是前文说的决策节点;Executor 执行工具调用,Verifier 评估证据是否充分,Generator 汇总生成最终答案。核心实验中,四个模块统一采用 Qwen2.5-7B-Instruct,挂载默认推理引擎、Python 代码执行、Google 搜索、维基百科搜索和网页检索五个工具。系统的四模块协作机制、内部记忆格式、可用工具列表以及模块之间的流转逻辑,从始至终由架构师预先确立,训练全程未做任何改动。发生变化的只有一个局部:Planner 内部决定分解子目标与调用工具的策略。论文也把扩展其他模块的学习能力列为后续研究,系统中大部分组件并未参与训练。
从工程实现来看,这套训练机制的运转逻辑并不复杂。面对同一个输入问题,系统并发运行 8 条真实的探索路径,每条路径都会实际触发搜索引擎、运行 Python 脚本并校验输出。任务执行完毕后,系统根据最终解答的成败给出整条路径的分数,路径上的每一个决策步骤共享这份结果信号。8 条路径的得分放在一起相互参照,表现优于均值的动作获得正向强化,落后于均值的动作受到抑制。论文把这套机制命名为 Flow-GRPO,用整条路径共用最终成败的粗粒度信号换取了训练收敛的稳定性。
判断训练是否真正起效,看行为变化比看总分更可靠。MedQA 医学问答基准提供了清晰的微观证据:训练前,决策节点有 66.2% 的调用集中在通用 Google 搜索上;训练后,Google 搜索的调用比例下降至 10.9%,模型自主转向了专业性更高的维基百科搜索(从 0 升到 59.8%)以及针对性更强的网页检索(从 0 升到 19.5%)。没有任何人工规则硬性规定它切换工具,是真实反馈重塑了它的默认行为倾向。模型并没有记住更多医学事实,它学会的是遇到医学问题先伸手抓专业工具的偏好。做编排的都碰过这种脾气,同一个工具挂在系统里,有的模型怎么写提示词都不肯调,改了几版 prompt 也压不住它的默认倾向。面对闭源模型只能忍着,因为模型动不了;开放权重加上这套训练闭环,才让这股脾气与个性第一次变得可调。在 GAIA 测试集中,工具调用错误率最高下降了 28.4%,表明模型不仅学会了挑选工具,也学会了如何正确组装调用参数。
训练改动的是决策节点的选择策略,工作流的拓扑结构保持原样。系统的骨架,包括模块流转、上下文管理规则与工具调用规范,依然建立在工程师前期的编排之上。没有这些确定性的状态记录、清晰的工具接口和可靠的验证标准,训练就缺少可信的成败信号。在我看来,这件事顺应了系统一直以来的分工原则:动态变化、需要随时引用与修正的事实留在模型外部,稳定、高频且能够客观评分的行为则吸收进权重。过去依靠提示词规则和 few-shot 示例硬塞在 harness 里的调用行为,一旦验证稳定就能沉淀进参数,harness 也不用在每次请求中重复背负这些样板逻辑。
在完全相同的系统骨架下,论文比较了决策节点的三种改法,这是全文最有参考价值的一组对照(Table 3)。基线是冻结的 Qwen2.5-7B 担任决策节点,六个基准平均 38.5 分。第一种改法是升级模型:把决策节点换成 GPT-4o,平均 44.3 分,多了 5.8 分。第二种改法是照抄:采集 GPT-4o 成功的操作轨迹,用监督微调(SFT)让 7B 模仿这些步骤,平均得分掉到 19.5 分,反而少了 19 分。第三种改法是在线训练:让 7B 决策节点在真实运行环境里边跑边学,平均 55.7 分,多出 17.2 分。
这三种尝试给出了截然不同的结果。换更强大的通用模型,它并不会天然契合这套特定工作流,增益止步于 5.8 分。照抄成功轨迹的监督微调出现了严重的性能滑坡,这个结果初看反常,实则符合动态系统的规律:agent 的每一个动作都建立在刚刚引发的新状态之上,直接模仿别人的动作序列,模型并未学会处理属于自己的意外工具返回。论文里这组 SFT 崩溃针对的是长程规划决策的蒸馏;交互步骤短、结果边界清晰的任务上,SFT 依然有效,后面讨论技术选型会用到这条边界。真正拉开差距的是第三条路径:同一个模型,放进正确的反馈闭环里训练,多出了 17.2 分。
标题那句 7B 打过 GPT-4o 也需要校准。它出自论文的主表实验:带完整工具的 7B 四模块系统对比不带任何工具的裸 GPT-4o,在四个领域高出 8.2 到 18 分,这种系统层面对单体模型的胜出不能过度解读。其余边界也应当清楚记录:实验对照用的是 2024 年中的 GPT-4o,基准多数只随机抽取 100 道题(AIME24 仅 30 题),且所有数据属于作者论文自评,目前尚无独立的第三方复现。
读到这里,不少开发者会考虑给自己的业务 agent 引入训练。进入工程实施之前,先过四道门,全部通过训练才有现实可行性。
第一道门:任务反复发生。训练决策节点需要前期的研发投入以及长期的运行维护。任务一周只触发几次,算力与工程成本很难摊平。调用量大、业务形态稳定、长期运行的高频负载,才有必要考虑训练。
第二道门:成败能自动判定。数学题对答案,代码跑测试,业务系统验证数据库状态变更。这些场景天然有可信的判分标尺。开放式的写作和调研没有标准答案,人工打分成本高昂且难以规模化,交给大模型裁判又容易引入判分偏置。AgentFlow 选择的搜索、数学、科学问答全落在自动判分容易的区间,这种任务选择是方法能够成立的前提。
第三道门:错误瓶颈集中在决策节点。训练能改善的是分解目标、挑选工具、判断何时终止的逻辑。如果复盘失败日志,发现症结出在检索召回不足、第三方 API 频繁报错或者上下文窗口管理失误,训练决策模型解决不了这些问题,应当优化的是外部工程设施。
第四道门:环境支持安全重置。在线训练依赖成千上万次真实调用交互,必然伴随大量失败尝试。调用的工具会不会产生不可逆的副作用,失败的成本由谁承担,都是必须考虑的问题。没有隔离、可重复、可快速复原的沙箱环境,训练开销容易失控,模型还可能学会钻判分规则的漏洞。
四道门过完,还有一个无需动用 GPU 的最小验证动作:从现有 agent 的历史运行日志中抽取一批真实失败样本,人工归纳失败原因(区分知识缺失、工具故障、格式错误、决策失误),同步确认成败能否自动判分,最后让小模型和大模型在相同的工具与调用预算下各跑一轮确立基线。归因与基线做完,训练该不该推进,答案通常自然浮现。
AgentFlow 原生方案是典型的实验室级配置:8 张 A100、每个样本并发 8 条探索路径、同步等待工具执行并由 GPT-4o 实时裁判(训练配置)。普通工程团队不必复刻这套重型架构,现阶段的技术栈提供了门槛更低的进入路径。
第一条路径:在现有 agent 代码上叠加训练接口。Unsloth 配合 OpenPipe 的 ART 是当前摩擦较小的组合(官方主张)。业务代码不用重构,接入轨迹采集和判分函数即可,训练后端可在本地 24GB 显存显卡、租用单张 A100、或 W&B 的 Serverless RL 之间切换(预览阶段训练免费,正式定价待公布)。OpenPipe 创始人分享过一个案例:14B 参数的邮件检索 agent,单张 A100 训完准确率达到 96%(半独立实践)。社区也有开发者用 RTX 4090 一小时教会一个 8B 开源模型基础的工具调用(独立实践)。这些实践数据指向同一个方向:起步门槛比预想更低。
第二条路径:接入解耦训练框架 Agent Lightning(官方主张)。它与 AgentFlow 有直接生态关系,AgentFlow 本身就是它官方收录的社区项目。核心思路是将训练引擎与 agent 运行时解耦,现有 agent 代码零改动接入。官方案例里一个 9B 模型用 6000 条训练样本把 SWE-bench Verified 解题率从 41.8% 提到 56.4%(论文,官方主张)。它还支持 Thinking Machines 的 Tinker 作为训练后端,属于按量付费的 API 模式,完全不需要本地 GPU,具体定价需要自行核实。
第三条路径:从两阶段轻量微调切入。先用 LoRA 在消费级显卡上过夜运行监督微调(租卡成本大约 5 到 30 美元),目标是内化工具调用的输入输出格式,不让模型过早承担长程规划。这方面的扎实证据来自 SWE-Gym:491 条严格过滤的交互轨迹,让 Qwen2.5-Coder-32B 在 SWE-bench Verified 上绝对提升 12 到 14 个百分点(ICML 2025 同行评审)。结合前文对照实验梳理的边界:SFT 固化短程可靠性行为有效,长程决策蒸馏则容易失效。把它当作第一级杠杆,格式与调用稳定性达标后,再视业务需要升级到在线训练。
这些路径的共同前置条件依然是四道门。门槛未满足前,先打磨检索质量与工具生态;门槛满足后,从判分最硬的局部业务模块开始试验。
性能方面,即便扣除外部工具加成与测试口径的折损,同等系统架构下在线训练带来 17.2 分的净增益依然站得住。成本方面,账目目前远没有算清。论文只披露了 8 张 A100,没有公布训练总时长、同步等待工具执行的闲置时间、GPT-4o 裁判调用的累积账单,以及上线后单次任务成本相对直接调用商业 API 节省了多少。近年商业 API 价格持续下行,托管开源模型的推理成本也在走低。自建训练体系省下的 token 差价,需要先覆盖数据构建、环境搭建、反复训练评测与长期维护的全生命周期开销,经济账才有说服力。调用量大的稳定业务流或许算得过来,低频多变的长尾场景几乎注定不划算。
开放权重的核心增量,在于给工程系统补上了过去长期锁死的策略优化层,而不只是更便宜的部署选项。外部编排负责确定性的骨架,涵盖状态流转、工具权限、记忆存储与终点验证;训练接管那些难以用硬编码规则穷尽的决策节点。规划自己的 agent 系统,若发现某个核心节点调用高频、判分客观且瓶颈卡在决策逻辑,可以把它选作第一个试验对象。在此之前,先把状态追踪与自动化判分做扎实,再谈训练。