AI 产品与平台社区与认知

AI 抬高了下限,评分标准还在惩罚上限

一场假战争

技术圈里聊起 AI 对学习的影响,大家通常迅速分成两派。一派把聊天框看作全天候家教,随时答疑,卡壳时点一下就能继续;另一派觉得这无非把抄作业包装得更体面,把题目往对话框一扔拿现成答案,久而久之思考习惯就会退化。我在四个月前讨论 AI 教育落地方向时也碰到过这两派:当时的主流叙事是给每个学生配一个 AI 家教,而土耳其高中实验已经提示,同一个模型在不同用法下会走向相反的结果。

学术界两场千人级随机对照实验,正好把这两种截然相反的走向摆到了台前。第一场在米兰,由 OpenAI 经济研究团队与大学合作发布,针对商科营销作业。1053 名大一新生要在 45 分钟内写一份不超过 180 词的方案,帮母校纪念品店提升校友知晓度与购买意愿。能用 ChatGPT 的学生,作业得分在 5 分制上比对照组高出近 1 分,策略与表达明显逼近三位专家现场手写的参考答案。单看卷面,初学者的作业明显逼近专家参考答案。

第二场在土耳其,是一所高中的数学实验,成果在 PNAS 正式发表。约 50 个班级、近 1000 名高中生经历了 4 次各 90 分钟教学与练习,成绩全部计入期末总评。课堂练习环节,使用标准 ChatGPT 辅助的学生,练习得分相对对照组高出 48%。然而转折来得极快。练习一结束,学生立即参加同一节课里的闭卷闭机测验。刚才还在练习里领先 48% 的学生,独立考试得分反而比对照组低了 17%。离开屏幕,他们立刻落后于只看课本笔记的普通同学。

同一个工具,在商科方案里把表达拉到接近专家水平,在数学考场上却让离开屏幕的学生考分跌落近两成。看似对立的走向其实是一场假战争,源于测量维度的错位。想看清背后的分界,只需要理清三个词:下限、上限与评分标准。把文案写得通顺完整、排版规整、挑不出硬伤,是下限;深入追问假设前提、推导因果链条、指出方案在什么边界下失效,是上限。而决定一份作业拿多少分的,是背后的评分标准究竟在奖励什么。带着这三个词回到现场,看似冲突的结论显出清晰的逻辑。

数学实验:下限是借来的

在土耳其高中的数学课堂上,学生面对 57 道代数与几何练习题。每次 90 分钟课堂切成复习讲授、辅助练习和无辅助测验三段。练习阶段屏幕亮起,AI 随时响应提问。对照组只有课本和笔记,练习平均得分是 0.28。使用标准 ChatGPT 辅助的学生,得分提升 0.137,相对提升 48%;定制了严格规则的老师模式组,得分提升 0.361,相对提升高达 127%。单看此时的卷面,老师模式让做题表现翻了一倍。

真正的考验在紧随其后的闭卷测验。练习一结束屏幕关闭,学生拿到概念相似的考题闭卷作答。对照组此时平均得分为 0.32。标准 ChatGPT 组测验得分下降 0.054,把考试表现拉低了 17%。而在练习中暴涨 127% 的老师模式组,测验变动只有负 0.004,在统计上与对照组分不出差异。屏幕上耀眼的优势在断网后迅速消失,伤害归零,增益也同样归零。

对着屏幕做题顺畅,离开工具却无法独立解题。研究人员统计了模型在 57 道练习题上的表现,发现标准 ChatGPT 平均只有 51% 给出正确答案,其中逻辑错误占 42%,算术错误占 8%。如果学生跟着推理思路做题,这些逻辑错误理应干扰后面的考试,但数据检验表明这部分偏差并未向后续考试溢出,关联系数仅为负 0.029,统计上不显著。学生没有受到错误逻辑的干扰,原因在于他们没有看推导。后台日志显示,学生最常见的动作是直接索要答案,抄在练习册上换取高分。学生直接跳过了推导思考,练习退化成把答案从屏幕搬到练习册。

为了阻断学生索要现成答案的动作,研究团队请来两名兼职数学教师,逐题整理标准解法与常见错误库,给系统设定了一套严格的老师模式:禁止直接给出解法,强制要求学生先展示做到了哪一步、卡点在哪里,只按最小幅度逐步给线索,并可校验学生自行给出的答案。这套老师模式管住了抄现成答案的冲动,保住了测验成绩不倒退。但即便投入了繁重的人工配置,学生脱离工具独自答题时,表现依然没有超越只看课本笔记的普通学生。课后自评还出现反差:标准 ChatGPT 组考得更差,自我感觉却很好;老师模式组考试成绩没有提高,主观评价却显著更好。顺畅的交互体验,轻易制造了掌握知识的幻觉。

在土耳其高中数学实验中,AI在场时学生练习成绩提升接近一半甚至翻倍,撤除AI后的闭卷考试成绩却不升反降

课堂练习与独立测验的反差,指出了看清技术影响的第一把尺子:测量的时候,AI 到底在不在场。梳理近两年的实证研究会看到清晰的分野:所有指出技术损害学习的发现,全部来自撤除 AI 后的无辅助测量;宣称学习表现大幅跃升的报道,记录的几乎全是 AI 在场或即时测量下的卷面。屏幕亮着时,试卷量出的只是一具人机联合体。工具能以极低成本把作业下限推到体面水准,但这种下限是向外部算力借来的。一旦拔掉网线关上屏幕,借来的下限瞬间消失,留在考卷前的依旧是未曾经历认知阻力的大脑。

营销作业实验:评分标准只认下限

数学题有客观对错。但在没有标准答案的商业策划与文科任务中,事情微妙得多。由 OpenAI 经济研究团队与大学合作发布的营销作业实验,把镜头推向商业写作。1053 名大一新生要在 45 分钟内为母校纪念品店写一份不超过 180 词的营销建议,提升校友知晓度与购买意愿。20 名硕士生担任独立盲评员,每份作业 3 人独立评,全场累计 3159 次打分,采用 1 到 5 分量表。

工具的加入迅速展现出抬高下限的威力。使用 ChatGPT 的学生组,得分比对照组高出 +0.862 分。对照组基准分只有 2.09 分,在模型协助下,学生平均分跃升至 2.95 分(经四舍五入推算)。在 5 分制下,这近 1 分的优势十分显著。三位专家(营销教授、纪念品店经理和校友专家)现场手写了平均 208 词的参考方案,以此规避预训练干扰。文本比对表明,ChatGPT 组与专家参考答案的相似度在三个指标上均显著上升。技术确实帮助缺乏经验的新生跨过表达门槛,写出了老练的策划案。

但接下来的实验却出现了一个出人意料的转折。研究团队设计了另一项干预:一门仅 9 分钟的思维训练课,动笔前玩包含 12 道题的思维小游戏,引导关注两件事:推导方案起效的因果机制,寻找方案在什么条件下会失效。短短 9 分钟改变了学生在这次作业里呈现的思考方式。文本分析显示,受训学生在作业中展现出更深入的思考特征:更擅长阐述策略起效的因果机制,明显更会主动写明方案在什么条件下会失效。一份既给出策略、又剖析机制并指出失效边界的策划案,理应获得更高评价。然而打分结果却极为冷淡:单独接受思维训练的学生组,得分微降 0.111 分;将思维训练与 ChatGPT 叠加,得分与单独使用 ChatGPT 组分不出差异。花精力深入推敲,在卷面上没有换来回报。

为什么想得更深反而拿不到高分?研究团队把评分表的细则逐项拆开,数字揭示出其中的真实取向。研究者用统计模型把评分结果逐项归因后看到:方案写明失效条件的答案,得分系统性偏低(关联强度 0.11 到 0.16 分);解释机制的答案同样偏低(0.17 到 0.24 分);离开常规解题思路也显著偏低。反过来,逻辑平稳连贯的答案得分偏高(关联 0.355 到 0.547 分),点子数量越多得分越高(每多一个加 0.09 到 0.12 分)。在 180 词篇幅里,认真思考的学生花字数界定假设、解释机制、提示风险,在评分员眼里反而显得不够果断。顺畅罗列几个促销套路的学生,却能轻松斩获高分。评分表的尺子只度量套路的完整性,探索认知上限的严谨推敲反而成了多余扣分项。

这项发现推翻了我最初的认知假设。我刚开始跟踪这项研究时,第一反应也是 AI 把大家的思考推向了均质化的平庸,当时在笔记里写道,生成式模型充当了套路生成器,抹平了独特想法,把大家装进同一个模具。但通读论文完整数据后,我意识到自己的归因反了。数据清晰记录着,ChatGPT 组不同点子之间的距离并没有缩小,解间差异统计系数为负 0.002,在统计上并不显著。AI 并没有把想法压缩在狭窄模具里,更没有抹平思路的丰富。

施加标准化压力的,是那张早已成型的传统评分表。这张评分表偏爱的正是四平八稳的标准解,深挖前提、暴露局限的写法反而换来扣分。而把标准方案写到连贯通顺这件事,AI 已经把它变得几乎不费力气。AI 像一面镜子,照出了传统评分标准对认知上限的长期压制。正如论文在摘要末尾写道,多元构想若要体现出价值,同样有赖于评价体系去鼓励求异与探索,而非只认标准解。

在米兰商学院实验中,学生详细阐述方案失效条件与作用机制不仅没有获得加分,评分表反而给这类内容扣分

这就带来了第二把尺子:现行的评分标准,到底在奖励什么。当一份作业借助 AI 获得漂亮高分时,不必急着庆祝。我们需要审视握在评价者手中的标准,看它究竟在鼓励探索问题本质的上限,还是在给迎合常规套路的下限发放奖赏。

怎么用

看清这两把尺子,日常工作与学习中该如何与 AI 共处,答案很具体,可以收束为三件事。第一件事,AI 在场时放心用,下限确实抬了。无论起草文档、整理纪要还是编写常规代码,模型搭建框架、补齐要素的能力切实存在。借助工具托住基础下限,把人从繁琐的初级表达中解放出来,本身就是实实在在的生产力。

第二件事,定期撤掉 AI 考自己,检验能力是否属于自己。一份漂亮的交付物,无法证明写作者真正掌握了底层逻辑。单看卷面,分不清一个人是真学会了,还是向算法买来了体面输出。无论团队还是个人,都需要设立无辅助的闭卷场景,在白纸上推导核心逻辑,确认关键能力长在自己脑子里。

第三件事,改评分标准,让它看得见上限。如果评价体系只给流畅辞藻、工整格式与常规套路打高分,甚至惩罚追问边界、揭示风险、探讨机制的深入思考,所有人最终都会走向借助模型批量制造平庸的循环。引导更深层的探索,必须重构评价导向,把重心从单方面奖赏标准答案,转向鼓励检验前提假设、推导因果机制与探索非常规方案。

在探讨技术对学习的影响时,还需要保持长期的诚实与克制。迄今为止,没有任何随机对照实验证明,设定了严密规则的老师模式 AI,能够在撤除工具后的独立考试上带来正向收益;至于长期保留,这类实验还没有测过。土耳其高中数学实验里,哪怕投入两名兼职数学教师逐题整理标准解法,学生闭卷考试的表现也仅仅与对照组持平。

目前在真实世界里找到的最稳固正向证据,来自技术对人类教师的帮助。在一项针对美国弱势社区数学辅导、涵盖 700 多名辅导员的随机对照实验中,这些辅导员配备实时专家建议后,所带学生掌握率整体提升了 4 个百分点;在原本评价较低的辅导员手里,掌握率更是显著提升了 9 个百分点。当技术用来辅助人类辅导员识别卡点、优化互动时,才展现出可靠的增益。这个方向我在之前分析 AI 教育杠杆点的文章里提出过一个假说:决定教育效果的更大变量可能在课的设计质量,而不在每个学生是否得到单独照顾;AI 更大的杠杆可能不在学生端配 AI 老师,而在帮老师把课变好。今天这两场实验等于给那个判断补上了新证据:连”配 AI 老师”里最成功的用法,都是让 AI 站在老师的位置上发挥作用。

当评价标准只愿为四平八稳的下限买单,再强大的工具也只会催生更廉价的套路;唯有当评价体系开始奖励突破常规的上限,人脑才会真正开始训练自己的思考。归根到底,两场实验给出的答案是同一句话:评价什么,决定训练什么。

参考来源

鸭哥每日手记

日更的深度AI新闻和分析