2026 年 9 月 17 日,OpenAI 宣布推出 Astra for Law。在独立评估机构 Vals AI 设立的法律研究基准私有验证集 200 道试题测试中,两侧均使用最高推理档,该产品取得 54.0% 通过率,相比仅使用普通网页搜索的基座模型 GPT-6 Astra 的 38.7% 高出 15.3 个百分点。官方口径宣称性能相对提升 40%,按基准数值核算实际提升幅度为 39.5%。
这组对比来自厂商自报口径,限定在 200 道题目的私有验证集,尚无第三方独立机构复验。司法实务容错率低。律师写法律备忘录,就算答准多数要点,只要关键判例有效状态看错,论证便失去效力,代理人面临执业过错追责。Vals AI 设定了细致的得分门槛,要求受测系统在单题全部细则上全数过关才计分,遗漏一项即判零分,此规则称为 all-pass。54.0% 仅代表系统满足测试细则的比例,这项指标不等于法律 AI 可以直接替代执业律师;其余 46% 未过关试题包含未答全细则的失分,不能等同于模型的幻觉率。
产品负责人 Boehmig 接受采访时说明(LawNext 采访):这套方案并未推出新模型,属于专为法律实务调优的模型配置。比纸面跑分更有参考价值的,是这种具体的工程做法,看清产品到底长什么样。
OpenAI 研发 Astra for Law,既未从零预训练垂直模型,也未执行全参数微调。系统主要由三部分组成:通用底座 GPT-6 Astra、外挂法律检索索引,以及针对法律分析与文书写作调优的系统指令。配套索引包含 2.3 亿个 URL,严格对应索引的网页与法律文档链接总数,不能当成 2.3 亿个独立司法判例;索引每日动态补充,覆盖美国成文法典、行政规章、法院诉讼规则与行政裁判文书。底层数据源自维护开源法律数据库 CourtListener 的非营利机构 Free Law Project。根据 Free Law Project wiki 页面 说明,该项目声称收录 99.9% 的美国已发表先例判例,但该声明以 2023 年为时间截点,同属服务商自报统计。
通用模型公司坐拥充沛算力与科研人才,切入门槛高企且客单付费意愿强烈的法律市场,既未重训垂直底座,也未开展领域微调,反而拿出了全场最省事的做法。这种技术选择引人深思。
原因藏在法律科技过去四年的变化脉络里。想看懂这类垂直 AI 产品,先看它长什么样。产品长成什么样,不仅关乎代码架构,更展现了厂商投入真金白银后的战略判断:从业者必须下注,垂直领域的攻坚难点,到底卡在神经网络权重内部,还是留在模型边界之外的支撑环境里?
行业常年存在一种惯性思维,认为大模型巨头进专业领域会推倒体系从头开始,垂直产业落地应针对专业语料重新训练专用底座,或至少完成全参数微调。这种预期伴随着心照不宣的技术评价链:将从零预训练与微调视作硬核重工,才配得上专业二字;梳理检索逻辑、打磨系统指令、搭评测框架容易贴上胶水拼装标签,认为再精细也停留在系统外围。OpenAI 选的产品长相,反过来冲击了这种偏见:算力储备富余的团队,主动挑了评价链底端的基础工作,打磨为受业界严肃审视的垂直产品。过去四年,市场各方用真金白银完成了一轮消融实验,只是彼时行业尚未普及这个术语。
最先经受实战检验退场的路线,是从零训练垂直领域的独立底座。早期团队坚信垂直专业存在语料壁垒,认定法律与金融文书充斥着特殊语法、古老术语与精密论证,通用语料无法消化,唯有依托垂直专属数据打底。Bloomberg 在 2023 年 3 月耗费巨资推出 BloombergGPT,采集包含 3630 亿 token 私有金融数据的训练语料,从零预训练出 500 亿参数模型。随着通用前沿底座以更大参数与多样语料往前走,通用复杂推理迅速拉开代际差距,专属中小模型撞上了天花板。彭博终端产品全球负责人 Wayne Barlow 在专访中挑明(a-teaminsight 专访):BloombergGPT 属于探索性质的研究模型,未落地于彭博任何正式商业产品;彭博现行产品矩阵建在多元模型混合架构上,涵盖商业专有模型、开放权重模型与自建小规模定制语言模型。自建垂直预训练底座的热度自此降温。
紧接着遭遇阻碍的方案,是在领域语料上给通用底座做全参数微调。主打律所业务流自动化的初创企业 Harvey,曾在第一代产品中搜集全美海量司法判例,对闭源顶级通用基座开展密集微调。现实阻碍接踵而至:成文法条与判例持续修订,将流动性法律事实写进神经网络静态权重,生成内容容易时效滞后;前沿通用推理模型跨代跃迁后,自带的通用认知能力抹平了微调维持的局部优势。商业调研机构 Sacra 在 Sacra 调研报告 中梳理:前沿推理底座迅速将法律逻辑推演转变为通用商品能力,Harvey 最终只能放弃此前重金微调的专有模型。
两轮路线更替沉淀下扎实的底层共识:脱离通用大模型的推演平台,封闭垂直模型很难在技术长跑中保持战斗力;试图把行业动态事实写入模型权重的微调思路,既跟不上基座演进步调,也无法满足实务对事实与时效准确性的标准。
经历两轮洗牌后,留存在竞技场内的团队达成共识:法律业务的攻坚瓶颈多数游离于通用认知之外,卡在模型外部的运行环境与专业支撑网络中。在走向成熟商用软件的探索中,各团队对难点到底在哪产生分化,演化出三种方向各异的产品下注路线。
在大型律所诉讼组内,年轻律师完成一份撤诉动议,在文书里援引了权威先例。法庭辩论开启后,对手律师拿出后来的裁判,指出该先例确立的核心裁判规则,两年前已在上诉审程序中由上诉法院改判推翻。法官当场裁定驳回动议,年轻律师不仅输掉诉讼,还面临执业过错调查。 这一事故揭示了法律条文的特殊属性:判决书中仅有针对争议焦点做出裁断的核心判定规则具备拘束力,术语称作 holding;法官延伸讨论或附带评论不具约束力,统称为 dicta。初审有效的 holding 可能在数年后遭更高法院撤销或改判。生效裁判每天持续对过往先例实施援引、背书、区分或推翻,交织成动态大网。律师起草文书若未能追踪后续裁决对要点的评价轨迹,便无从断定其在当前是否有效。法学工业中动态标定裁决效力存续状态的索引网络,正是历经百年演进的判例引证关系图谱。
数据出版巨头立足这套引证关系,建起了权威内容与交叉核验的护城河。拥有百年案例库与专业法律编辑团队的 Thomson Reuters,以及手握百年引证核验品牌的 LexisNexis,把筹码押在模型外的数据基石上。Thomson Reuters 在专栏中指出(TR 博客):决定法律 AI 格局的关键变量深扎在模型依托的内容地基里,基座模型本身不构成核心区隔。其背后是 1500 多位专业法律编辑手工梳理的判例库与 KeyCite 效力校验体系。LexisNexis 采取相似技术打法,2026 年 5 月推出 Protégé 平台时,首席执行官 Sean Fitzpatrick 定调(LexisNexis 公告):法律 AI 必须交付律师有据可查、法庭上从容答辩、经得起信赖的业务成果。该平台依托 Shepard’s 引证检验体系交叉校验,通过技能路由在定制工具链与 Anthropic 驱动的技能间切换。 据厂商自述,Thomson Reuters 曾试水改造权重:投入约 4000 万美元(厂商披露算力开销约合 10 万至 20 万美元,消耗 35207 个 B200 GPU 小时),以开源 Qwen 底座完成持续预训练与领域微调,推出 Thomson 1.0 模型。官方报告显示,其 AIME 数学能力从 93.3 分跌至 90.0 分,Terminal-Bench 从 45.2 分滑至 40.5 分,研发团队不得不引入多模型混合路由架构拉平衰减。改动权重的代价在这里摆得格外具体。
微调路线退场后,围绕模型权重的尝试为什么又重获生机?关键在于两者面对的技术课题截然不同。早先退场的微调路线偏重静态知识灌注,试图将动态法条与判例事实写入参数,难以跟上司法现实变化;以 Tenet 为代表的后训练探索聚焦行为习惯塑造,通过强化学习驱使模型在多步流程中反复演练,打磨检索、取舍与长程推演的行为范式。做事的行为模式比具体条文稳定,融会后不易发生知识陈旧。 专攻律所工作流的初创公司 Harvey 选定这一路径:启动 Tenet 后训练专项,选定深耕长上下文的 Kimi K3 底座,联合提供推理与训练云设施的 Fireworks,基于异步强化学习算法 GSPO,调集约 150 块 B300 GPU 训练两个月(厂商自报数据);最终在 LAB 留出评测任务中,受训模型综合完成率相较初始基座实现接近翻倍的飞跃(同为厂商自报)。Harvey 团队在技术复盘中总结(训练复盘):后训练、评测流水线优化与打分器架构设计必须紧密咬合;模型能展现何种上限,取决于外部训练环境提供了多大探索空间。他们坚信,复杂的法律逻辑推演与长程思维链必须刻入参数深处,外部拼装胶水难以复现这种深度。
第三种路径把精力投在模型周围的工作流接入层,让模型以配置参数和外挂插件形态嵌入办公软件。科技巨头在这项决策上展现出战略协同:微软于 4 月在 Word 内集成 Legal Agent;Anthropic 于 5 月推出带外接插件与 MCP 协议连接器的 Claude for Legal;谷歌在 8 月推出 Gemini Enterprise for Legal;9 月 OpenAI 发布 Astra for Law。四家巨头均采用外围配置与插件接入,没有一家预训练专属垂直模型。打造多模型法律协作工作台的初创团队 Legora 也选择相同立足点,业务重点向表格化合同审查与协同门户倾斜,将底层基础模型视作解耦替换的通用组件,这一实用主义工程选择在 Hacker News 讨论 社区中引发了广泛共鸣。
图 1:法律 AI
市场的三种存活赌注对比:内容与验证层、权重层与接入层的难点假设与形态差异
想看清接入层这条路径怎么走,Astra for Law 提供了现成的工程样本。系统直接沿用通用旗舰底座 GPT-6 Astra,未调整内部参数,增量工作全围绕外围组件展开。在数据检索维度,系统配套挂载收录 2.3 亿个 URL 的法律检索索引。前面提到过,这项指标统计网页与文档链接总数,并不代表独立判例总量;在非营利机构 Free Law Project 语料供给下每日动态更新,让模型能随时检索现行生效判例法、联邦及州成文法、行政法条、诉讼指引与行政裁决。在逻辑引导层面,团队打磨了一整套系统指令,针对实务中的线索检索、焦点提炼与备忘录格式做细致规整,规范模型按律师逻辑输出分析。在安全合规维度,平台搭建起面向企业法律场景的治理防御体系。
在数据治理板块,OpenAI 为选定律所开通直通 ChatGPT 与 Codex 的 Trusted Access 专用通道,为符合条件的律所提供 API 零数据留存,并默认将 ChatGPT Enterprise 使用记录排除在人工审核之外。合规框架由 OpenAI 与知名律所 Latham & Watkins 合作设计,针对权限隔离、道德防火墙、客户指令与律所监督进行适配,LawNext 报道 披露零数据留存协议多达约 30 页。伴随产品推出,官方公布了生态伙伴阵容:26 款合作方开发的插件、9 款社区维护插件与 47 项定制技能,并推出打通编辑场景的 ChatGPT for Word 应用。插件覆盖 Thomson Reuters 旗下 HighQ 与 CoCounsel Legal 连接器预览版,亦纳入 iManage、Intapp 与 DeepJudge 等专业服务商。首发开放 26 个插件席位表明,平台大厂收敛了端到端包办细分业务的野心,从工程逻辑上认可专业工作流掌控权依然归属于深耕产业的应用软件商。
官方宣传的 54.0% 战报,实测证据边界需客观剖析。Vals AI 基准页面 标注该测试基于私有验证集,结论属于厂商自报。若按 200 道试题单轮等权、全对或全错计分,基座模型的 38.7% 会对应 77.4 道题,题数出现非整数,指向可能存在多轮推演平均、跨层级聚合或加权核算(新配置的 54.0% 在算术上恰好等于 108/200,两边数字精度不对称,但不能据此反推实际答对题数),具体口径官方未澄清。Vals AI 官方 X 贴文 证实这批数据来自厂商自测,并披露另一组厂商自报结果:加权评分 90.0% 对 84.1%、all-pass 达标率 53.7% 对 39.6%,正借助未公开的保留测试集闭门复核。在基于 208 道未公开测试题的公共基准榜上,目前仅能查到未加装套件的裸版 GPT-6 Astra 成绩,表现为 49% 上下(全榜 61 款模型中排第 20 名,前两名以 55.29% 并列第一),加装法律配置的版本尚未建立正式公共记录。
OpenAI 在宣讲中列举的两组对比用例,同样具备演示样本的局限。在诉讼研究案例中,通用模型援引了 2025 年特拉华州初审法院裁决 Paragon Metal Holdings v. Smith。特拉华最高法院已于 2026 年 7 月 1 日部分推翻该裁决(就正当信赖推翻原判发回重审,维持陈述虚假性结论),通用模型未识别效力变化,Astra for Law 则检索到了这项后续推翻判决;在非诉交易审查案例中,Astra for Law 定位到了在反诉部分适用马萨诸塞州实体法的纽约南区联邦地区法院判例 Oliver Wyman v. Eielson(282 F. Supp. 3d 684 (S.D.N.Y. 2017)),对照组模型出现遗漏。Technology.org 报道 提示,这两组由厂商挑选的案例未经独立复测;单次定点展示难以证明模型在实际高频调用中触发类似问题的真实概率分布。
随着这项法律配置直接内置到原生平台,行业不同生态层级承受的冲击呈现分化。直接挨了重击的是技术积累薄弱的简单套壳工具。过去初创项目搭个简易的向量数据库查询界面,外接通用大模型 API,便向律所按人头席位推销软件。如今 OpenAI 已向选定律所开放 GPT-6 Astra Law 原生服务入口,打包了覆盖 2.3 亿 URL 的外部索引、法律指令集与企业级数据治理方案,单纯依仗提示词技巧与基础检索外壳的初级工具,失去了向客户持续收费的生存根基。
处于第二生态梯队的成熟垂直软件展现出防御韧性。深耕律所业务流程的
Harvey 实现了商业增长。根据 Sacra
调研报告、ARR.club 与 valueaddvc 等来源,Harvey 年经常性收入从 2025
年 8 月的 1 亿美元,跳升至 2026 年 3 月的 1.9 亿美元和 5 月的 3
亿美元,并在 2026 年 9 月达到 4 亿美元,估值由 30 亿美元升至 155
亿美元(数据来自厂商自报与机构估算,未经独立审计)。业务渗透方面,Harvey
切入全美排名前一百大律所中的 80% 与《财富》五百强企业中的
20%,主要采取按人头计价的席位订阅模式(第三方估算,大律所每月每位用户约
100 至 200 美元,并非官方公开报价)。OpenAI 已点名 Harvey 与 Legora
将作为即将开放的 gpt-6-astra-law 专属 API
的客户。平台升级重塑了初创团队自建大模型的投入逻辑,但律所内部的人员分工、审批流转与权限网络,依然掌握在垂直厂商手里。
立于行业第三层的在位数据出版巨头避开了正面冲击。Thomson Reuters 与 LexisNexis 仰仗百年来构建的引证效力图谱、独家注释体系以及律所管理软件生态,垒砌起深厚的内容壁垒,开放互联网的通用网页索引并未动摇其根基。真正的张力折射在另一个层面。Hacker News 讨论 社区流传着一句评述:不用担心,他们完全可以把业务继续搭在平台之上。把核心交付全寄托在基座接口上的垂直厂商,在享受大模型轻量配置红利的同时,不得不时刻提防平台在后续版本中推移功能边界的潜在威胁。
图 2:Astra for Law
发布的杀伤面分层:薄封装被直接吸收、应用层从模型转向工作流、在位数据巨头保持隔离
把 Astra for Law 的技术形态看一遍,能为探索其他垂直行业落地的 AI 工程师提炼出两条工程结论。
一条工程认知落在评测基准设计上:在垂直赛道开展后训练评估,对照基线中必须强制引入专业配置的通用基座。业内研发团队对外宣讲技术突破时,往往习惯将自研行业模型与裸版通用基座粗暴对照,随后把性能增益全归功于内部权重调整。Astra for Law 打破了这种定式:在未改动底层架构的前提下,仅仅通过加装垂直检索索引、融合精细打磨的分析指令并跑通闭环测评,系统在私有验证集的 all-pass 口径下获得了厂商自报的 15.3 个百分点提升,尚未经独立复验。沿着这一证据推演:主张自研专用模型或修改网络权重者,若未能与配置同等优质索引和提示工程的通用基座严格对照,测出的性能跃迁便大概率混杂着水分。把外部配置的性能天花板摸透,是决策者权衡要不要改动权重的必经基线。
工程人员确实应该复盘法律科技赛道,因为这里构成了一座检验大模型能力边界的高压测试场。该领域文书公开,门槛很高,对事实差错近乎零容忍,误引失效判例就可能招致执业过错赔偿;同时行业具备高利润率与软件预算,能负担高昂探索开销。四年里,法律市场走过从零预训练垂直底座、全量微调、强化学习后训练到回归轻量配置的完整周期,留下一部行业消融实验档案。由此自然延伸出第二条结论:审视垂直技术方案,管用的评估顺序应当是优先看清它产品长什么样,进而严审对比基线。这一逻辑瓦解了轻视外围工程的思维鄙视链:衡量一种技术手段的价值,在于评估它改变了多大比例的难题分布;调整权重不过是资源投入的成本权衡,不能单凭代码写在模型内外而判定高低贵贱。
文章写到这里,还有两个问题没有答案,它们会决定这套轻量配置的真实分量。
第一个是 Vals AI 正在做的独立保留测试集复测。54.0% 仅源于私有验证集之上的厂商自报,评测机构正借助一套未公开的 208 道试题保留测试集开展闭门复验。由通用底座、外挂索引与系统指令组装而成的轻量方案,在隔绝潜在数据接触的盲测环境下到底能不能复现私有验证集的表现,将成为裁定这套专业配置方案是否经得起推敲的核心证据。
第二个是 OpenAI 针对 gpt-6-astra-law 专属 API
接口制定的商业定价策略。该接口未来面向 Harvey、Legora
等专业开发者开放,平台如何为这套整合了 2.3 亿 URL
法律索引与专属指令的接口划定资费,将直接影响垂直产业链条的利润分配。倘若专属
API
计费接近基础通用模型,应用层便能以较低边际成本复用现成基础设施,转化为利润空间与交付体系;假若平台巨头仗着索引规模与合规壁垒索取高额溢价,垂直应用团队势必重新去算自建检索或转向开源方案这笔账。这个价格标签最终定下来,正是衡量平台巨头对外围配置壁垒到底有多大信心的试金石。