当 AI 能完成作业,大学该教什么、怎么考?MIT 的 26 项重构建议

MIT 用 8 条原则、4 种课程政策和 26 项行动,把学习目标、评估、住宿制共同体与持续治理连成一套可迭代的教育改造方法。

MIT 校园与主楼穹顶

MIT 关于“教学、学习与研究训练中的 AI 使用”报告,由一个临时委员会经过 5 个月的会议、调研与校内沟通完成。它不只讨论怎样限制 AI,而是提出 8 条指导原则和 3 大类、26 项建议,试图回答一个更根本的问题:当作业的答案可以随手生成,大学如何仍能让学生真正学会、证明自己学会,并在人与人的关系中成长?


先看现状:使用已经普遍,不安也同时存在

报告汇总了三组问卷。它们的调查对象、时间和题目不同,不能直接拼成一个“MIT 全校使用率”,但能互相印证一个现象:AI 已经是校园学习和工作流程的常见部分。

  • 委员会的 AI 使用与态度调查收到 1,632 份回复,总回复率为 12%。受访者中,44% 表示自己“经常”或“非常经常”使用 ChatGPT;学生为 46%,教师和教学人员为 35%。
  • 校本部约 8,200 人参与的 Quality of Life Survey 中,总体约 40% 经常或非常经常使用生成式 AI;本科生为 46%。
  • 学生报纸 The Tech 的调查收到 1,002 份回复。在本科生受访者中,46% 每天使用大语言模型,30% 每周使用数次;90% 对过度依赖至少有些担心,其中 67% 非常担心。

MIT Quality of Life Survey 中不同群体使用生成式 AI 的频率

这些数字背后有一对同时存在的感受。受访者普遍认为 AI 技能很重要,也认为 AI 提高了效率;另一方面,他们也感到自己在变得更依赖它。报告用了 cognitive offloading(认知外包)、overreliance(过度依赖)和 cognitive surrender(认知屈从)这些表达:学生在第一个卡点就把思考交给 AI,可能损害批判思维、记忆、信心和对知识的掌握。这是报告引用的早期信号和师生担忧,还不是已经建立的长期因果结论。

调查也有明确限制。委员会问卷回复率只有 12%,The Tech 调查同样来自自愿回复者;对 AI 更有态度、使用更多或更少的人,都可能更愿意填写问卷。这些调查能帮助 MIT 识别问题,却不能直接代表所有 MIT 成员,更不能代表所有大学。

再定原则:先保护学习和人,再决定技术放在哪里

委员会用 8 条原则给后续建议划定方向。它们在两类张力之间建立约束:技术变化很快,学校既不能自信地宣布已有定论,也不能把不确定当成不行动的理由;AI 可以增强人的能力,学校也必须防止它代替学生本应经历的思考、判断和人际关系。

  1. 保持谦逊(Be humble):承认技术和其影响仍在快速演化,今天的提案一定还需要校正。
  2. 大胆行动(Be bold):不用零散补丁应对结构性变化,也不放弃个性化辅导和研究创新的机会。
  3. 把人性放在中心(Put humanity front and center):效率不能成为唯一标准,师生连接、学徒制和人的成长也是教育产出。
  4. 直面学习本身(Lean into learning):学习需要“有生产力的挣扎”;最重要的产品不是分数或文凭,而是学生的想象力、洞察力和判断力。
  5. 有意图地教(Teach with intentionality):先定义学习目标,再决定是否、何时和怎样使用 AI。
  6. 不追求一刀切(No one size fits all):诗歌研讨课、数学证明课和建筑设计实验室,需要的 AI 边界必然不同。
  7. 增强而非自动化(Augmentation not automation):让 AI 帮人承担新任务、获得新专长,同时保留人的主动性和责任。
  8. 把视野放到课堂和校园之外(Think beyond the classroom and the campus):考虑学生步入工作、公民生活和 AI 创造环境后需要的技能与责任。

这八条原则被进一步整理成三类工作:让教育过程适应 AI 已经存在的世界;把人、共同体和住宿制教育置于中心;建立能持续反思、迭代和改进的流程、团队与工具。

然后设计课程:从学习目标倒推作业和 AI 规则

报告引入了 Backward Design(逆向设计)。教师不从“这门课要不要禁止 AI”开始,而是先问:学生最后应该知道什么?能做什么?应该学会重视什么?第二步,设计能证明这些目标已达成的评估证据。第三步,才是作业和学习活动,以及 AI 在其中被允许、限制或要求的位置。

Backward Design → 持续治理

别从“能不能用 AI”开始

报告的决策顺序是一个闭环:每次的测量和校园反馈,都应该回到学习目标,启动下一轮修正。

  1. 01学习目标知道、能做、重视什么
  2. 02评估证据什么能证明真正掌握
  3. 03活动与政策设计作业,界定 AI 位置
  4. 04人与组织保护共同体,提供实施支持
  5. 05测量与修正跟踪效果、成本与新风险

这一顺序最后要落实成清楚、可见的课程规则。委员会建议每门课都在课程大纲和课程网站醒目公布 AI 使用政策,让学生明确知道什么时候、在哪里、为什么允许、限制或要求使用 AI。

附录 B 给出四种可供课程选择和改写的政策模板。它们是服务于不同学习目标的并列选择:

  1. Unrestricted GenAI Use(不限制使用):学生自主决定如何使用,但仍要对学习、原创性和最终提交负责。适合主要通过课内无 AI 评估验证能力,或评估、整合 AI 输出本身就是任务的课程。
  2. Limited GenAI Use: Support Tool Only(有限使用:只作支持工具):可用于学习支持、头脑风暴、编辑、调试或解释,不能产生完整或大部分作业解答。学生需要区分自己的工作和 AI 辅助内容,并引用 AI 产生的材料或想法。
  3. Required GenAI Use(要求使用):学生按规定流程使用指定工具,并提交所要求的 AI 互动记录。适合 AI 辅助编程、提示设计、模型输出批评、人机协作或 AI 系统评估本身就是学习目标的作业。
  4. GenAI Use Strictly Prohibited(严格禁止使用):学生不能在作业中使用生成式 AI。适合需要建立基础知识和独立解题能力,或作业的核心价值就是未经辅助的表达和思考的课程。
同一份菜单,四种学习目标

课程政策不是严到松的单线排名

Unrestricted

不限制使用

用在:评估与整合 AI 输出本身就是能力,或另有课内无 AI 评估。

Limited

只作支持工具

用在:要保留独立解题,但允许辅导、编辑、调试或解释。

Required

按指定方式使用

用在:AI 协作、提示设计、输出批评或系统评估就是学习目标。

Prohibited

严格禁止使用

用在:需要亲自建立基础直觉、独立解题或未经辅助表达。

共同规则:选择哪一种,都要和学习目标连起来,并向学生说明理由。

四种模板的共同点是规则必须说明理由。禁止 AI 时,教师要说明它会捷径化哪个基础学习过程;鼓励 AI 时,也要说明它如何扩展学生能做的工作。学生仍是所有提交内容的责任人。

透明还应该是双向的。报告鼓励教师披露自己在课程编排、作业创建和反馈中如何使用 AI;学生付出真实时间后,如果只收到机器生成的反馈,他们的负面感受并不难理解。对研究成果,报告建议所有学位论文声明 AI 如何被使用,AI 不应被列为共同作者,人类作者必须验证输出并对准确性负责。

课程规则之外,学校还要系统教授 AI 素养。The Tech 的调查中,超过三分之二的学生认为 AI 对职业生涯很重要,但只有 25% 认为 MIT 已充分帮助他们做好使用 AI 的准备。报告把三种相连但不同的能力拆开:有效使用是会描述问题、验证输出、识别幻觉,并知道什么时候不该求助 AI;负责使用是分清增强人与替代人的界线,诚实披露 AI 的贡献;合乎伦理地使用则要讨论训练数据来源、偏见、输出同质化、知识产权、环境成本,以及辅助与冒充作者之间的界线。委员会建议从本科生和研究生迎新开始,把这些内容贯穿到各专业课程与研究训练中。

报告还收录了一个具体案例:一名教师介绍,为学习调解的学生提供个性化、课程专用的 AI coach,减少了当着他人练习公开表达的尴尬,增加了练习意愿,继而提高了技能。这是委员会听到的一个案例;报告没有进一步披露它的内部技术架构。

面对快速变化的技术,委员会还建议支持负责任的课程实验:院系可以更敏捷地探索课程调整,但必须认真评估结果,并保持整个培养体系的长期连贯性。报告提出,可以试办 AI-heavy 和严格的 AI-light 课程或路径;对于不愿使用 AI 的学生,只要学科条件允许,也应认真提供尽量少用 AI 的选择。

作业改了,评估也要改:从一份答案转向多种证据

MIT 标志性的 Problem Sets(P-Sets)长期用于训练数理计算和工程推理。报告认为,许多用于强化学习和评估进展的问题与作业,已经可以由 AI 完成。所以,在无限制使用 AI 的情况下,单凭课后提交的正确答案,越来越难以证明学生个人的真实理解。

报告没有宣布一种新评估已普遍落地,而是提出多种可组合的选项:

  • 书面评估+口试:用口头问答检验学生能否解释解法、应用知识,而不只是提交完成品。
  • 课内、当面或实验室评估:为现场考试、实验操作、表演和演示提供足够的场地与时间。
  • 项目和亲身实作:增加情境化、开放式、依赖实际设计和团队协作的任务。AI 有时也可以扩大项目野心:报告提到,软件工程课可以让学生在一学期内构建更接近生产级的系统,再把时间放在现实环境中的设计权衡上。
  • 阶段节点与版本历史:让学生分阶段展示项目进展,或提交版本记录,为思路如何演变提供过程证据。

评估重构不能简单退化成“把更多分数压到限时课内考试”。报告要求 MIT 重新考虑分数在整个体系里的作用,探索 competency-based、mastery-based assessment 和项目作品集,让能力证明不只剩一张成绩单。口试的即时反馈、项目书面反馈和持续作品记录,往往比一个分数更能告诉学生自己真正掌握了什么。

当面互动也不能只发生在考场。委员会建议每门课都设置定期、结构化、服务于明确学习目标的社交学习,例如有阶段检查的团队项目、助教引导的协作解题、围绕统一量规的反馈讨论。相应地,学校还要提供有人支持的实验室和协作空间,包括纯线下空间或配备 AI-free、AI-limited 电脑的场地;否则增加实验、团队任务和当面评估只会停在课程设计文件里。

报告对“用更强的技术抓作弊”很警惕。AI 检测器不可靠,还可能把非英语母语者或神经多样性学生的写作误判为 AI 生成;MIT 的纪律委员会不把检测器输出单独当作学术诚信案件的足够证据。当前一代 lockdown browser 在报告看来容易出错、有监控感;在多数情况下,报告更倾向当面监考。它的思路是用更好的学习证据建立信任,尽量避免把课堂变成师生互相怀疑的地方。

但大学不只是课程:住宿制共同体也是学习基础设施

委员会听到了课后答疑、线上讨论以及宿舍、图书馆里的学习小组参与下降的反馈。报告明确把其中部分叙述标为 anecdotal(轶事性):它提示风险,却不能证明 AI 就是唯一或直接原因。AI 进入校园时,学生焦虑、孤独和人际疏离早已是更广泛的背景问题。

对 MIT 而言,面对面互动不是可替换的装饰。和同学一起拆解证明、反复调试实验、当面争论,既支持知识建构,也训练沟通、求助、协作与建立信任的能力。

因此,学校不只要解释住宿制教育为何重要,还要主动重建共同规范、共同仪式和支持系统。报告提出的例子包括跨群体讨论人生与职业选择、为面对面连接预留的 Tech Free Times,以及扩大共同阅读和讨论;教师和工作人员也要能识别 AI 加剧的学业、社交与情绪困难,并把学生转介到合适的支持渠道。与此同时,MIT 需要承认从热情、怀疑到拒绝使用 AI 的不同立场,并支持减轻训练数据、社会、环境等负面影响的研究与政策工作。

UROP(本科研究机会计划)是关键案例。报告称,它直接覆盖了 93% 的本科生和 58% 的教师。它不只让学生取得学分或薪酬,也让他们进入研究共同体:观察研究问题如何形成,判断力如何发展,错误如何被建设性地解释,功劳如何分配,分歧如何处理,知识又如何被集体生产。如果教师因效率而用 AI agent 取代本科研究助理,可能会保住短期研究产出,却失去研究作为学徒训练的教育价值。因此报告建议保护并扩大 UROP 等经历,让更多学生能够参与,并考虑把类似体验延伸到实验室以外。

最后建立治理:别把系统性改革留给单个教师

重设一门课的目标、评估和活动已经是大量工作,在全校范围持续更新,更不能依赖一批教师的个人热情。报告因此提出一组相互衔接的组织设计:

  • 设立长期运作的 AI 与教育委员会,追踪校内外影响、技术变化与新证据,负责战略、评估和政策协调。
  • 在各学院或院系设置 AI Leads,让课程改造和政策适配贴近学科。
  • 资助 AI Fellows 与 AI Implementation Team,由技术、AI 与学习科学专长支持教师、开发校级工具,并研究工具在现场怎样被用、造成什么效果。
  • 建立 AI Pilot Fund,为 AI 点数、助教、UROP、夏季支持等成本提供资源,既支持 AI-enabled 实验,也支持有意为之的 AI-free 学习体验。
  • 用培训、同行分享和校内实践社群,让教师之间传递有效做法;同时跟踪 AI 使用、校园参与、学生满意度和毕业后反馈。

组织支持还包括公平的技术入口。报告指出,当时头部商业模型的高阶方案最高可达 200 美元/月,而研究者的 API 使用可能高得多。MIT 已运行 model-agnostic 的 Parley,为每位成员提供多模型访问和每月最高 30 美元的免费点数;报告同时承认,这对某些课程,特别是软件工程课,可能还不够。

“公平入口”也不只是给每个人一个聊天框。报告要求校级系统覆盖 agentic coding 和工作工具,并为需要训练或微调模型的课程提供足够的本地或云端算力;否则学生即使名义上都能访问 AI,实际能完成的任务仍会因经济条件和基础设施而分化。

公平访问和隐私不能分开。商业 AI 服务默认记录用户会话时,敏感课程数据或研究材料存在被纳入训练的可能;报告因此支持保持模型中立,并探索更多本地托管的开源模型访问。但校级平台又带来新问题:用户会向 AI 询问健康、关系、情绪和焦虑等私密内容,而教师又可能希望通过对话日志理解学习过程。谁可以看、保留多久、什么情况下可以干预,都需要公开、透明的日志与审计政策。

报告还要求 MIT 跟踪 AI 的财务与环境成本。训练和推理都消耗能源,数据中心还涉及用水、建设和硬件材料。企业数据不透明、成本分散在整个模型生命周期,意味着这些影响很难精确计算。委员会的建议是,公开不同模型的环境成本估算,审计学校自身的 AI 足迹,并投资更低能耗的方法。

26 项建议怎样带走

报告特别提醒,这 26 项建议不是可以彼此割裂、逐项打勾的待办,而是一组需要协同推进的改变:教育过程 10 项,人与共同体 6 项,持续治理 10 项。正文已经解释其中的关键关系;文末的“MIT AI 教育改革带走包”提供完整 26 条速查表,以及附录 B 的四种课程 AI 政策选择卡,均可直接复制 Markdown 或下载 .md 文件。

这份报告最可复用的,是一个能够迭代的教育系统

MIT 没有宣称找到所有大学的标准答案。“谦逊”是报告的第一原则,持续修正也被写入组织设计。它最有价值的部分,是把原本容易分散的决策连成一个闭环:

教育目标 → 评估证据 → 作业与课程政策 → 人际与组织支持 → 指标、反思与新一轮修正。

对中文教育实践者而言,这个顺序比照搬任何一条“禁用”或“必用”政策更值得参考。先把这门课真正要培养的能力说清,再判断什么必须由学生亲自完成,什么适合借力 AI,怎样用多种证据确认学习,最后让组织对资源、公平、隐私和长期影响负责。

这些建议有明确的适用边界。它们深度依赖 MIT 的高强度实作文化、研究型大学资源和住宿制社群;问卷的回复率与自选样本也限制了数据的外推。报告的最终边界同样保持张力:AI 可以让学生更高效、支持学习和科学发现,也会冲击学习过程、教学实践与住宿制教育的社会织理。人类智慧、连接、判断和亲身实作,正是这轮教育重设计需要优先保护的对象。

MARKDOWN TAKEAWAY

MIT AI 教育改革带走包

两份可直接复制或下载的 Markdown:26 项建议完整速查,以及四种课程 AI 政策选择卡。

MIT 的 26 项教育重构建议 下载 .md
四种课程 AI 政策选择卡 下载 .md

来源
Report: AI Use in Teaching, Learning, and Research TrainingMIT Ad Hoc Committee on AI Use in Teaching, Learning, and Research Training·查看主材料
本站说明
文中调查数据来自报告附录汇总的三组问卷;样本、回复率和自选偏差限制其外推。