8 月 27 日,OpenAI 发布研究报道《Better answers, broader thinking: What students gain from ChatGPT and critical-thinking training》,并同步公开论文《Training novices to think, or giving them LLMs? Evidence from an RCT》。这项由博科尼大学(Bocconi University)研究者与 OpenAI 经济研究团队合作的预注册随机对照实验,把一个在教育界争论已久的问题变成了可以测量的问题:当学生用 ChatGPT 完成真实作业时,质量的提升是否以牺牲原创性为代价?

实验的回答是:两种干预作用在不同层面。ChatGPT 访问权提升了作业的质量与连贯性;一次因果推理训练——批判性思维的一种形式——则让学生产出更多独特的想法。同时接受两者的学生,两组效果兼得。

实验在博科尼大学进行:1,053 名经济学、管理学与金融学的大一新生、13 个班级,在课堂时间内完成一项真实商业案例——为学校的纪念品商店撰写不超过 180 词的咨询式营销建议,目标是提升校友对商店的知晓度与使用率,营销学中的两个标准指标。学生事先不知道自己正在参与实验,参与即正常出勤。

按班级随机分组,学生进入四种条件之一:仅因果推理训练(256 人)、仅 ChatGPT 访问(197 人)、两者皆有(351 人,超额抽样以检验交互效应)、两者皆无(249 人对照组)。因果推理训练与 AI 无关,通过一个游戏、若干示例、问题与反馈完成教学,训练学生把问题组织成"原因—机制—结果"的链条,并说明方案在什么条件下会失效;ChatGPT 组获得的是教育版访问权(GPT-4o)。

评价采取双轨:20 名硕士生担任评分者,每份方案由 3 人按 1—5 分量表打分;自动文本分析则分别测量每份方案的想法数量与多样性、因果推理的迹象,以及与 3 位领域专家方案的相似度。

2×2 矩阵信息图:横向为是否有 ChatGPT 访问权限,纵向为是否接受因果推理训练。四个分组分别为对照组(N=249)、仅 ChatGPT(N=197)、仅训练(N=256)与双干预组(N=351),各组在量表得分、想法数量、想法多样性与因果推理三项指标(机制、可证伪性、连贯逻辑)上的变化以箭头标注。
图:OpenAI 官方实验结果图。仅 ChatGPT 组量表得分 +0.85、想法更多而多样性不变;仅训练组想法多样性上升而得分不变;双干预组在机制、可证伪性与连贯逻辑三项因果推理指标上呈现全实验最强增益。, Figure by OpenAI, from the blog post 'Better answers, broader thinking' (Aug 27, 2026).

获得 ChatGPT 访问权的组,在五点量表上比对照组(估计均值约 2.09 分)高出约 0.85 分。他们的方案包含更多想法、逻辑更清晰,也更接近专家写出的推荐——用论文的话说,LLM 让新手在训练有素的标准化任务上" resemblance 专家"。论文的效应分解显示,文本连贯性与想法数量约能解释其中一半,其余部分在所有控制变量下依然存在:模型改善的不只是表述,还有方案的内容实质。

值得记录的是 OpenAI 强调的一点:学生并不是把作业整体交给 ChatGPT。他们仍需决定问什么、评估模型的回答、选择哪些内容进入最终方案。

因果推理训练带来了更出乎意料的结果。完成训练的学生能更清楚地解释自己的方案为什么可行、何时会失效——机制识别提升约 0.5 个标准差,可证伪逻辑提升约 0.8 个标准差。但他们的量表得分没有提高:评分标准只衡量方案对"提升知晓度与使用率"两个标准营销目标的回应程度。

文本分析揭示了量表没有捕捉到的收益:完成训练的学生产出的想法范围更宽,与同侪的想法距离更远。论文对此的表述是,传统量表可以奖励一份清晰、结构良好的回答,却无法奖励"想出一个别人都没有的想法"。数据中还有一个更冷的细节:评分者奖励方案内想法的丰富度,却惩罚偏离典型方案空间的方案。

同时接受两者的学生表现出两组效果的叠加:想法多样性与仅训练组持平,量表得分与想法数量和仅 ChatGPT 组相当;而在连贯逻辑、可证伪逻辑与机制理解三项因果推理指标上,这一组呈现出整个实验中最强的增益。总体上,结合组的获益覆盖了最宽的测量维度。

论文里最值得教育者留意的一句结论藏在结果深处:因果训练的收益在 LLM 可用时依然存在——学会了的推理技能并没有被"外包"挤掉。随机设计让研究者得以把 ChatGPT 访问、思维训练与两者组合的效果彼此分离,这也是这项研究对快速增长的"AI 与学生"文献的主要贡献。

实验指向一个更大的问题。当 AI 能帮助学生产出打磨精良、类专家的作品时,只看最终答案,对学生真正理解了多少所提供的信息越来越少。论文的措辞更进一步:实验所用的量表惩罚偏离常规答案的方案——"如果我们想超越常规答案,约束条件可能在于我们要求与评估多样、新颖、原创答案的能力",而这是 LLM 正在让更显眼、更紧迫的一个长期难题。

OpenAI 把这个问题放进一种延续数十年的模式里:技术与教育共同演化,服务于学生进入现代社会所需的技能。相应地,作业与评估需要开始奖励原创性、推理过程与多方案考量,而不只是最常规、最漂亮的答案。

一句话的结论:AI 让学生的答案更好,思维训练让学生的想法更宽。在为学生未来做准备这件事上,两者扮演着互补的角色。