
TL;DR:Strömberg、Lei 与 Wu 在 2026 年 6 月发布的 CEPR 讨论论文,分析中国中部一个县 26,811 名 7—12 年级学生的 30 个月数据,估计采用生成式 AI 六个月后,作业成绩约提高 18%、完成时间约减少 30%,月度闭卷考试成绩却约下降 20%。论文还称,学习损失主要集中在行为符合“作业外包”的约 80% 使用者;但这不是随机试验,采用时间来自回溯调查,样本也只有一个县,不能把结果写成“AI 必然让所有学生退步”。
一份作业交得更快、答案更好看,通常会被视为学习进步。生成式 AI 进入作业以后,这个判断可能不再可靠:作业衡量的,越来越像学生和工具共同完成任务的能力;闭卷考试测到的,仍然是学生离开工具后能独立运用多少知识。
这项研究最有价值的地方,不是给 AI 教育判死刑,而是把“完成任务”和“形成能力”拆成了两个指标。它还留下一个重要反例:使用 AI 但没有大幅减少作业时间的学生,论文观察到的学习损失较小。
🎬 视频版(B站) | 🎧 音频版(7 分 09 秒)| 🟢 Spotify 订阅 | 📖 偏好阅读?文字版就在下方 👇
这项研究到底观察了什么
论文题为 The Generative AI Learning Penalty: Evidence from Chinese Secondary Education,作者是 David Strömberg、Victor Lei 和 Yanhui Wu。CEPR 将它作为第 21577 号讨论论文发布,页面日期为 2026 年 6 月 2 日。
研究对象来自中国中部一个县,共 26,811 名 7—12 年级学生。数据覆盖 2022 年 9 月至 2025 年 6 月,持续 30 个月,包含九个学科的三类记录:
- 数字作业平台上的成绩和完成时间;
- 每月闭卷考试成绩;
- 中考和高考成绩。
研究者没有随机指定谁能用 AI,而是利用学生在不同时点开始使用生成式 AI 的差异,采用交错采用双重差分来估计变化。学生的采用时间来自 2025 年进行的回溯调查,研究者要求他们查看应用注册日期后回答。
因此,这是一项规模很大的观察研究,不是随机对照试验。它比一次问卷更接近真实长期使用,却仍然可能受到自报误差、采用者差异和无法观测因素影响。

《听懂 AI》第 017 期节目封面。节目从“作业高分、考试下降”的反差切入,本文进一步核对了论文方法、结果与外推边界。
三个指标朝着相反方向走
论文报告,采用生成式 AI 六个月后,学生作业成绩相对基准均值约提高 18%,单次作业平均完成时间约从 64 分钟降到 45 分钟,相当于减少约 30%。
如果只看作业报表,这是一轮很漂亮的效率提升。可在同一时期,月度闭卷考试成绩的估计值约下降 20%。论文称,这项损失在采用后的六个月里逐步扩大,而不是完成一次 AI 作业后立刻出现。

图中数字均为论文作者的估计,不是对所有学生的固定预测,也不是原始分数直接增减 18 或 20 分。
“下降 20%”尤其容易被误读。它是论文模型对样本平均结果的估计,不能理解成每个使用 AI 的学生都从 100 分掉到 80 分,更不能直接外推成智力或认知能力下降 20%。
这组数据说明的是:在这一个县、这段时间和这套评估中,AI 辅助下的作业表现与无辅助考试表现明显分离。
“作业外包”是根据行为推断,不是逐题监控
研究者把非常短的作业时间与很高的作业分同时出现,解释为行为符合 homework outsourcing,也就是“作业外包”。CEPR 摘要称,学习损失主要集中在约 80% 的 AI 使用者中,他们的行为呈现这种特征。
这里的措辞必须谨慎。研究并没有录屏检查每名学生是否复制了答案,也没有逐题判断 AI 替学生完成了多少思考。“外包”是根据完成时间与成绩分布作出的机制推断。
论文讨论了一个醒目的时间区间:非 AI 学生完成作业通常至少需要约 50 分钟,而不少 AI 使用者在 20—50 分钟内完成,作业分高,考试分却低。研究者认为,工具省掉的不只是查资料和机械输入,也可能省掉了提取、试错、修正和重新组织知识的过程。
这不代表“坐满 50 分钟”就能自动学会。作者也明确提醒,作业时长与考试成绩之间的关系不是随机因果结果,强行把作业拖长未必有效。时间在这里更像一项过程信号,而不是教育处方。
最重要的反例:保住学习投入的人损失较小
CEPR 摘要没有把所有 AI 使用方式归为一类。它特别指出,作业完成时间与非 AI 学生相近的使用者,学习损失较小。
论文对 50—65 分钟重叠区间的分析显示,两组学生的考试成绩中位数和四分位距相近。这个结果支持一种更窄的解释:生成式 AI 主要替多数使用者减少了学习时间,却没有明显降低那些保持相近投入者的学习效率。
它不等于已经证明“辅导式 AI 一定有效”。愿意继续投入较长时间的学生,可能本来就在动机、自控或学习策略上不同;观察数据难以排除这些差异。但它至少反驳了“只要碰 AI 就会损害学习”的简单结论。
问题不只是“用了没有”,而是工具在任务里承担了什么角色:
- 直接给出可提交答案,替学生完成主要推理;
- 只给提示,让学生继续尝试;
- 检查已经完成的答案,指出漏洞;
- 充当口试官,追问学生为什么这样做。
前一种方式优化交付,后三种方式更有机会保留练习。论文直接观察到的是时间、成绩与采用行为,具体交互策略仍需要更细的实验验证。
为什么闭卷考试仍然值得看
HN 讨论中有一种反驳:现实工作允许使用 AI,学校为什么还用不能带工具的考试衡量学生?这个问题成立,但不能因此把闭卷结果全部丢掉。
如果教育目标只是按时交付一个结果,AI 辅助作业已经能测到这种能力。如果目标还包括理解概念、发现错误、把方法迁移到新题和在工具失效时独立判断,就需要一种把外部帮助暂时拿走的评估。
闭卷考试不等于完美测量学习。题目质量、应试训练和考试焦虑都会影响成绩。不过在这项研究里,月度闭卷考、中考和高考提供了与作业不同的视角:它们不再允许学生把生成式 AI 的输出直接当作个人能力。
论文还报告,使用满约两年的学生中,中考与高考成绩的估计降幅分别约为 24% 和 18%。CEPR 摘要把两项高风险考试的完整损失描述为大约两年后才显现。这里同样是样本平均估计,不是每位长期使用者都会出现的固定结果。
为什么尖子生也可能损失更多
研究发现,学习损失在初中生、高成绩学生和男生中更大;学科上以社会科学最大,其次是 STEM 和语言类。CEPR 摘要确认了这个排序,详细分组幅度则来自论文分析。
“成绩越好,跌得越多”与不少职场 AI 研究中低技能者受益更多的结果不同。一个可能解释是,高成绩学生原本能从高质量练习中获得更多,一旦把练习环节交出去,失去的也更多。
这只是机制解释,不是论文已经证明的心理过程。它也不能推出“尖子生不该使用 AI”。更稳妥的含义是:过去成绩好,不能保证一个人天然免疫于认知外包。
研究做了哪些核对,又留下哪些缺口
为了排除“本来成绩就在下降”的解释,论文检查了采用前趋势;为了减少各校命题差异的影响,又使用全县统一试卷重估,研究包记录的降幅约为 23%;研究者还用采用前的 2022 年中考成绩进行安慰剂检验,结果接近零。
这些检验提高了结果的可信度,但不会把观察研究变成随机试验。发布这组数字时至少要保留四项边界:
- 样本只来自中国中部一个县,不能代表全国、大学生或职场人;
- AI 采用时间来自回溯自报,注册日期也不等于每次实际使用;
- 研究主要观察“是否采用、用了多久”,无法完整还原每次人机互动;
- 2022—2025 年间工具能力和使用习惯持续变化,结果不一定原样适用于未来产品。
论文目前是 CEPR 讨论论文,并不是一项已经由多地随机试验反复验证的教育定律。它给出了重要的长期风险信号,也给后续研究留下了明确任务:随机比较答案式、提示式、反馈式和口试式 AI,分别测即时表现、延迟记忆和迁移能力。
学校和个人应该改变什么
第一,不再把 AI 可参与完成的作业分数直接当成学习成果。作业仍可以用于练习和反馈,但需要另设无辅助的小测、口头解释、现场演示或新情境迁移题。
第二,保留过程证据。让学生提交第一版思路、错误记录、修改理由和对 AI 建议的取舍,比只看最终答案更能判断学习是否发生。
第三,把 AI 设置成不给完整答案的辅导员。可以要求它一次只给一个提示、先让学生解释当前思路、针对错误追问,或者连续进行多轮口试。HN 用户提出的“让 AI 追问五轮”属于社区建议,不是论文验证过的干预方案,但很适合用来暴露只会复述、不理解原理的情况。
第四,定期做一次无辅助复现。对学生是闭卷题和口头讲解;对程序员、分析师和写作者,则可以是离开 AI 后解释方案、找出错误、从空白开始完成一个缩小版任务。
这项研究给职场的类比属于编辑性延伸,不是论文结论:交付数量、周转速度和成品质量,像作业分;隔几个月后还能否独立判断、复现与质疑,才更接近无辅助考试。如果报表只记录前者,团队可能在产出越来越漂亮时,才发现独立判断能力已经下降。
收看本期节目
原始资料与延伸阅读
本文由《听懂 AI》第 017 期整理而成,研究状态核对至 2026 年 9 月 3 日。核心数字来自 CEPR 讨论论文 DP21577 及其摘要,属于作者对单一县域观察数据的估计;SCMP、《经济学人》和 PPC Land 用于核对报道语境,HN 评论仅作为社区观点。关于学校与职场的建议含编辑性归纳,不是论文已经验证的干预效果。
- David Strömberg、Victor Lei、Yanhui Wu,CEPR,2026-06-02:The Generative AI Learning Penalty: Evidence from Chinese Secondary Education——论文摘要、作者、样本、识别方法与主要结果。
- SSRN:The Generative AI Learning Penalty: Evidence from Chinese Secondary Education——工作论文页面与版本入口。
- The Economist,2026-08-18:Does AI stop children from learning?——本期选题的主要报道原文之一。
- Zhang Tong,South China Morning Post,2026-07-14:AI homework tools cut exam scores by 20%, study of 26,000 Chinese students finds——研究数字、工具使用率与“流利感错觉”的报道。
- PPC Land:Students who use AI for homework lose 20% of their exam scores——作业指标失真与职场类比;属于二次解读。
- Hacker News:AI boosted homework scores, then exam scores dropped: study——对考试意义、因果识别、50—65 分钟重叠区间和 AI 口试的社区讨论。
- Fortune,2026-07-21:Study finds AI boosted homework scores 18%—then tanked exam results 20%——面向大众的研究报道;标题语气较强,本文没有沿用其确定性归因。
资料说明:SSRN 页面与《经济学人》原文在本次整理环境中受访问限制,关键数字改由可访问的 CEPR 官方摘要、SCMP 报道和项目内研究摘录交叉核对;未将无法直接核验的页面细节写入正文。