教师 AI 最容易证明的是节省了多少备课时间。教案生成更快,分层材料制作更快,反馈覆盖的学生更多。这些数字能解释产品为什么被采用,却无法证明它创造了教育价值。真正决定产品价值的是:节省下来的时间是否改变了教师行为,这种变化是否让学生获得了可以保持和迁移的学习能力。
大多数产品只测到了因果链的前端。学校真正需要的是完整链条:
实际使用 → 时间与负担 → 教师产出 → 课堂实践 → 学生行为 → 即时掌握 → 延迟保持与迁移
每个箭头都是一个需要验证的假设。任何一层断开,备课效率都无法自动传导为学习收益。
ChatGPT 和 Claude 分别完成了不同的一半
ChatGPT for Teachers 于 2025 年 11 月发布,面向美国经验证的 K-12 教师提供安全工作区。它在系统层的优势很明确:domain claiming、SAML SSO、RBAC、协作、分析和教育级数据保护。学区终于拥有一条相对成熟的部署和治理路径。
Claude for Teachers 于 2026 年 7 月发布,切入点更靠近课程与教学实践。它连接 Learning Commons、全美 50 州学术标准、OpenSciEd 和 Illustrative Mathematics,并提供备课、分层教学、班级数据分析和 exit ticket 复盘等 Skills。Anthropic 表示,这些 Skills 已评估教学法对齐、严谨性和课堂可用性。
两种路径形成了清晰对照。OpenAI 先解决学区部署与治理,Anthropic 先解决课程标准和教师任务。两家公司公开材料中仍缺少一条从教师产品使用到学生长期结果的完整证据链。
这并非少了几组营销数字,而是系统架构缺了一层。治理验证谁可以使用,课程对齐验证产出是否符合标准。它们都无法直接证明教师实施得好、学生进行了有效学习,或能力在撤掉 AI 后仍然存在。
效率收益是真实的,也只覆盖第一段
教师效率方面最扎实的因果证据之一来自 NFER 的学校层随机试验。研究覆盖 68 所学校的 259 名七、八年级科学教师。第六至第十周,ChatGPT 组每周备课约 56.2 分钟,对照组为 81.5 分钟,平均减少 25.3 分钟,约为 31%。盲评专家没有发现两组教学资源质量差异。
这个结果很有价值:教师能用更少时间完成材料制作,而且产出没有出现可检测的质量下降。
研究没有测量学生学习成果。学校如果在这里停止测量,就无法知道教师把时间重新投入了学生交流、行政任务、休息恢复,还是生产更多内容。这些用途都可能有价值,但教育回报完全不同。
节省时间是系统输入,不是最终结果。
缺失的中间层是课堂实践
教师 AI 必须通过一个中介影响学生:教师实际做了什么。符合标准的教案只有改变课堂行为,才能产生因果作用。
Tutor CoPilot 的预注册随机试验覆盖约 900 名 tutor 和 1,800 名 K-12 学生。得到实时 AI 建议的 tutor 更常使用引导性问题,让学生解释思路,也更少直接给答案。对应学生通过 exit ticket 的概率从 62% 提升到 66%。低评分 tutor 对应的提升达到 9 个百分点。
这项研究连接了三层:AI 支持、教学行为改变、学生即时结果。它仍然属于近端测量。Exit ticket 无法证明学生在数周后仍然记得,或能把知识迁移到新情境。
另一项自动教师反馈随机研究发现,反馈让教师使用 focusing questions 的比例提高 20%,其他教学行为没有明显变化。这个结果揭示了反馈闭环的真实样子:工具可能精准改变一个实践,而非重塑整间教室。
所以学校需要直接测量机制,不能只检查教案。
更好的材料仍可能带来更差的结果
效率自动传导为学习收益的假设尤其危险,因为负面影响经常出现在因果链下游。
2026 年 6 月的一篇 SSRN 工作论文 报告了土耳其初高中随机现场实验。研究发现,向教师提供生成式 AI 支持后,学生内在动机下降 0.11 个标准差。平均成绩没有变化,基线教学表现较弱教师所教学生的成绩和信心出现负面影响。论文尚未完成同行评审,需要进一步复现。
即使把它视为早期信号,失败路径也值得重视:AI 降低内容生产成本,教师随之改变教学方式,学生获得的 productive struggle 和针对性调整反而减少。教师感受到效率,学生感受到参与感下降。
完整测量体系必须同时寻找伤害,而非只验证预期收益。
OpenAI 的 Measurement Suite 指向了正确方向
OpenAI 在 2026 年 3 月发布 Learning Outcomes Measurement Suite,合作方包括 University of Tartu 与 Stanford SCALE。它把测量分成三组信号:模型如何行动,学习者如何响应,认知结果如何随时间变化。
具体组件包括 learning interaction classifiers、quality graders、longitudinal graders,以及标准化认知和元认知量表。系统可以观察参与、纠错、坚持、批判性思维、创造力、记忆,并连接外部考试与课堂数据。
OpenAI 还公布了 300 多名大学生的早期随机试验。使用 Study Mode 的学生在微观经济学考试中相对无 AI 对照组高约 15%,神经科学结果方向为正,但与传统在线资源没有统计可区分性。官方也明确承认,收益能否保持仍是开放问题。
这比使用量看板前进了一大步,但框架主要面向学生直接与 ChatGPT 互动。教师 AI 还需要补充两层:教师如何处理 AI 输出,课堂实施发生了什么变化。缺少这两个中介层,学区无法区分学生变化来自教师工具、专业培训、课程内容、模型行为,还是实施质量。
学校需要一套八层测量栈
| 层级 | 核心问题 | 推荐指标 |
|---|---|---|
| 1. 接触与使用 | 教师到底怎么用 | 任务类型、频率、采纳率、输出修改率 |
| 2. 时间与负担 | 哪些负担发生变化 | 任务计时、工作时长、认知负荷、时间再分配 |
| 3. 教师产出 | 教案和反馈是否更好 | 盲评 rubric、错误率、标准对齐、多样性 |
| 4. 课堂实践 | 教学行为改变了什么 | 课堂观察、话语分析、提问、分层支持、1:1 时间 |
| 5. 学生过程 | 学生如何响应 | 参与、动机、坚持、元认知、求助模式 |
| 6. 即时学习 | 当堂掌握了什么 | exit ticket、外部评分测验、课程任务 |
| 7. 持久学习 | 撤掉 AI 后还会什么 | 延迟测验、迁移任务、无 AI 考试 |
| 8. 系统结果 | 谁受益,成本多高 | 教师与学生异质性、隐私、信任、成本效益 |
这套结构可以防止几种常见替代:激活账号等于有效使用,优质教案等于优质课堂,有 AI 时完成任务等于独立掌握,平均正效应等于所有群体受益。
最低可信因果设计
学区的每次试点不必都变成大型学术研究,但需要能区分真实改善、参与热情、选择偏差和测量偏差。
一项重要部署至少应包含:
- 比较组。条件允许时按学校、教师或班级随机分配。
- 预注册主结果,并报告包含低使用者的 ITT 效应。
- 教师、学生和学校情境的基线数据。
- Implementation fidelity,判断干预是否真正进入课堂。
- 至少一个由产品之外的系统生成或评分的学习结果。
- 撤掉 AI 后的延迟测验与迁移任务。
- 按教师经验、原有教学水平、学生基础和学校资源报告异质性。
- 样本流失、隐私事件、教师 override 与意外影响记录。
What Works Clearinghouse 已经提供成熟的教育因果评估标准。核心原则可以压缩成一句话:产品不能只用自己生成的内容和自己定义的评分证明自己有效。
把看板变成控制系统
测量只有改变行动时才产生价值。学区需要按不同节奏处理不同信号。
每日信号负责工具故障、不安全输出和负担异常。每周信号负责采用、教师修改、课堂实施和 exit ticket。学期分析关注动机、成绩、公平与成本。年度评估决定续约、重构或退出。
每个指标还需要明确责任人与响应规则。教师节省时间但学生动机下降时,学校可以调整允许场景或加强培训。产出质量高但课堂实施率低时,问题更可能在工作流集成。收益集中在原本优秀教师时,规模化之前应先重做支持系统。
完整反馈闭环是:
测量 → 找到断裂环节 → 调整产品、培训或政策 → 再测量
教师 AI 由此从功能集合变成可校准的教育基础设施。
采购要问一条完整因果链
学校采购通常会问安全性、课程标准、部署难度和教师满意度。这些都是必要条件。还需要继续问五个问题:
- 产品预计改变哪种教师行为?
- 哪种学生学习过程会因此变化?
- 什么外部指标能发现收益或伤害?
- 撤掉工具后,效果需要维持多久?
- 什么证据会触发限用、重构或停止部署?
只能回答采用率和节省工时的厂商,描述的是运营效率。能连接实际使用、教师决策、课堂实施与持久学习的厂商,才在描述教育干预。
教师 AI 的反馈闭环抵达学生之后,信任才真正开始建立。在此之前,再精美的看板也可能只是在测量整个系统中最容易的一段。
FAQ
AI 是否真的能帮教师节省时间?
NFER 随机试验在测量期内发现每周备课时间减少约 31%,同时没有发现资源质量下降。该研究没有测量学生结果。
教师使用 AI 是否能提高学生成绩?
结果取决于具体场景。Tutor CoPilot 将 AI 支持的教学行为连接到 exit ticket 通过率提高 4 个百分点。通用教师效率产品的公开学生结果证据仍然有限。
为什么只看考试成绩还不够?
一次考试可能测到即时任务表现,同时漏掉动机、延迟保持、迁移、公平,以及学生在撤掉 AI 后是否仍会独立完成。
学校应该先测什么?
先测实际使用、时间流向、教师产出盲评、课堂实施、学生参与和至少一项外部学习结果。
可以让 AI 自己评估教育效果吗?
AI grader 适合产生快速过程信号。重要结论还需要外部测验、人工复核和独立因果设计。