当 AI 能完成作业,大学该教什么、怎么考?MIT 的 26 项重构建议
MIT 用 8 条原则、4 种课程政策和 26 项行动,把学习目标、评估、住宿制共同体与持续治理连成一套可迭代的教育改造方法。

MIT 关于“教学、学习与研究训练中的 AI 使用”报告,由一个临时委员会经过 5 个月的会议、调研与校内沟通完成。它不只讨论怎样限制 AI,而是提出 8 条指导原则和 3 大类、26 项建议,试图回答一个更根本的问题:当作业的答案可以随手生成,大学如何仍能让学生真正学会、证明自己学会,并在人与人的关系中成长?
先看现状:使用已经普遍,不安也同时存在
报告汇总了三组问卷。它们的调查对象、时间和题目不同,不能直接拼成一个“MIT 全校使用率”,但能互相印证一个现象:AI 已经是校园学习和工作流程的常见部分。
- 委员会的 AI 使用与态度调查收到 1,632 份回复,总回复率为 12%。受访者中,44% 表示自己“经常”或“非常经常”使用 ChatGPT;学生为 46%,教师和教学人员为 35%。
- 校本部约 8,200 人参与的 Quality of Life Survey 中,总体约 40% 经常或非常经常使用生成式 AI;本科生为 46%。
- 学生报纸 The Tech 的调查收到 1,002 份回复。在本科生受访者中,46% 每天使用大语言模型,30% 每周使用数次;90% 对过度依赖至少有些担心,其中 67% 非常担心。

这些数字背后有一对同时存在的感受。受访者普遍认为 AI 技能很重要,也认为 AI 提高了效率;另一方面,他们也感到自己在变得更依赖它。报告用了 cognitive offloading(认知外包)、overreliance(过度依赖)和 cognitive surrender(认知屈从)这些表达:学生在第一个卡点就把思考交给 AI,可能损害批判思维、记忆、信心和对知识的掌握。这是报告引用的早期信号和师生担忧,还不是已经建立的长期因果结论。
调查也有明确限制。委员会问卷回复率只有 12%,The Tech 调查同样来自自愿回复者;对 AI 更有态度、使用更多或更少的人,都可能更愿意填写问卷。这些调查能帮助 MIT 识别问题,却不能直接代表所有 MIT 成员,更不能代表所有大学。
再定原则:先保护学习和人,再决定技术放在哪里
委员会用 8 条原则给后续建议划定方向。它们在两类张力之间建立约束:技术变化很快,学校既不能自信地宣布已有定论,也不能把不确定当成不行动的理由;AI 可以增强人的能力,学校也必须防止它代替学生本应经历的思考、判断和人际关系。
- 保持谦逊(Be humble):承认技术和其影响仍在快速演化,今天的提案一定还需要校正。
- 大胆行动(Be bold):不用零散补丁应对结构性变化,也不放弃个性化辅导和研究创新的机会。
- 把人性放在中心(Put humanity front and center):效率不能成为唯一标准,师生连接、学徒制和人的成长也是教育产出。
- 直面学习本身(Lean into learning):学习需要“有生产力的挣扎”;最重要的产品不是分数或文凭,而是学生的想象力、洞察力和判断力。
- 有意图地教(Teach with intentionality):先定义学习目标,再决定是否、何时和怎样使用 AI。
- 不追求一刀切(No one size fits all):诗歌研讨课、数学证明课和建筑设计实验室,需要的 AI 边界必然不同。
- 增强而非自动化(Augmentation not automation):让 AI 帮人承担新任务、获得新专长,同时保留人的主动性和责任。
- 把视野放到课堂和校园之外(Think beyond the classroom and the campus):考虑学生步入工作、公民生活和 AI 创造环境后需要的技能与责任。
这八条原则被进一步整理成三类工作:让教育过程适应 AI 已经存在的世界;把人、共同体和住宿制教育置于中心;建立能持续反思、迭代和改进的流程、团队与工具。
然后设计课程:从学习目标倒推作业和 AI 规则
报告引入了 Backward Design(逆向设计)。教师不从“这门课要不要禁止 AI”开始,而是先问:学生最后应该知道什么?能做什么?应该学会重视什么?第二步,设计能证明这些目标已达成的评估证据。第三步,才是作业和学习活动,以及 AI 在其中被允许、限制或要求的位置。
别从“能不能用 AI”开始
报告的决策顺序是一个闭环:每次的测量和校园反馈,都应该回到学习目标,启动下一轮修正。
- 01学习目标知道、能做、重视什么
- 02评估证据什么能证明真正掌握
- 03活动与政策设计作业,界定 AI 位置
- 04人与组织保护共同体,提供实施支持
- 05测量与修正跟踪效果、成本与新风险
这一顺序最后要落实成清楚、可见的课程规则。委员会建议每门课都在课程大纲和课程网站醒目公布 AI 使用政策,让学生明确知道什么时候、在哪里、为什么允许、限制或要求使用 AI。
附录 B 给出四种可供课程选择和改写的政策模板。它们是服务于不同学习目标的并列选择:
- Unrestricted GenAI Use(不限制使用):学生自主决定如何使用,但仍要对学习、原创性和最终提交负责。适合主要通过课内无 AI 评估验证能力,或评估、整合 AI 输出本身就是任务的课程。
- Limited GenAI Use: Support Tool Only(有限使用:只作支持工具):可用于学习支持、头脑风暴、编辑、调试或解释,不能产生完整或大部分作业解答。学生需要区分自己的工作和 AI 辅助内容,并引用 AI 产生的材料或想法。
- Required GenAI Use(要求使用):学生按规定流程使用指定工具,并提交所要求的 AI 互动记录。适合 AI 辅助编程、提示设计、模型输出批评、人机协作或 AI 系统评估本身就是学习目标的作业。
- GenAI Use Strictly Prohibited(严格禁止使用):学生不能在作业中使用生成式 AI。适合需要建立基础知识和独立解题能力,或作业的核心价值就是未经辅助的表达和思考的课程。
课程政策不是严到松的单线排名
不限制使用
用在:评估与整合 AI 输出本身就是能力,或另有课内无 AI 评估。
只作支持工具
用在:要保留独立解题,但允许辅导、编辑、调试或解释。
按指定方式使用
用在:AI 协作、提示设计、输出批评或系统评估就是学习目标。
严格禁止使用
用在:需要亲自建立基础直觉、独立解题或未经辅助表达。
共同规则:选择哪一种,都要和学习目标连起来,并向学生说明理由。
四种模板的共同点是规则必须说明理由。禁止 AI 时,教师要说明它会捷径化哪个基础学习过程;鼓励 AI 时,也要说明它如何扩展学生能做的工作。学生仍是所有提交内容的责任人。
透明还应该是双向的。报告鼓励教师披露自己在课程编排、作业创建和反馈中如何使用 AI;学生付出真实时间后,如果只收到机器生成的反馈,他们的负面感受并不难理解。对研究成果,报告建议所有学位论文声明 AI 如何被使用,AI 不应被列为共同作者,人类作者必须验证输出并对准确性负责。
课程规则之外,学校还要系统教授 AI 素养。The Tech 的调查中,超过三分之二的学生认为 AI 对职业生涯很重要,但只有 25% 认为 MIT 已充分帮助他们做好使用 AI 的准备。报告把三种相连但不同的能力拆开:有效使用是会描述问题、验证输出、识别幻觉,并知道什么时候不该求助 AI;负责使用是分清增强人与替代人的界线,诚实披露 AI 的贡献;合乎伦理地使用则要讨论训练数据来源、偏见、输出同质化、知识产权、环境成本,以及辅助与冒充作者之间的界线。委员会建议从本科生和研究生迎新开始,把这些内容贯穿到各专业课程与研究训练中。
报告还收录了一个具体案例:一名教师介绍,为学习调解的学生提供个性化、课程专用的 AI coach,减少了当着他人练习公开表达的尴尬,增加了练习意愿,继而提高了技能。这是委员会听到的一个案例;报告没有进一步披露它的内部技术架构。
面对快速变化的技术,委员会还建议支持负责任的课程实验:院系可以更敏捷地探索课程调整,但必须认真评估结果,并保持整个培养体系的长期连贯性。报告提出,可以试办 AI-heavy 和严格的 AI-light 课程或路径;对于不愿使用 AI 的学生,只要学科条件允许,也应认真提供尽量少用 AI 的选择。
作业改了,评估也要改:从一份答案转向多种证据
MIT 标志性的 Problem Sets(P-Sets)长期用于训练数理计算和工程推理。报告认为,许多用于强化学习和评估进展的问题与作业,已经可以由 AI 完成。所以,在无限制使用 AI 的情况下,单凭课后提交的正确答案,越来越难以证明学生个人的真实理解。
报告没有宣布一种新评估已普遍落地,而是提出多种可组合的选项:
- 书面评估+口试:用口头问答检验学生能否解释解法、应用知识,而不只是提交完成品。
- 课内、当面或实验室评估:为现场考试、实验操作、表演和演示提供足够的场地与时间。
- 项目和亲身实作:增加情境化、开放式、依赖实际设计和团队协作的任务。AI 有时也可以扩大项目野心:报告提到,软件工程课可以让学生在一学期内构建更接近生产级的系统,再把时间放在现实环境中的设计权衡上。
- 阶段节点与版本历史:让学生分阶段展示项目进展,或提交版本记录,为思路如何演变提供过程证据。
评估重构不能简单退化成“把更多分数压到限时课内考试”。报告要求 MIT 重新考虑分数在整个体系里的作用,探索 competency-based、mastery-based assessment 和项目作品集,让能力证明不只剩一张成绩单。口试的即时反馈、项目书面反馈和持续作品记录,往往比一个分数更能告诉学生自己真正掌握了什么。
当面互动也不能只发生在考场。委员会建议每门课都设置定期、结构化、服务于明确学习目标的社交学习,例如有阶段检查的团队项目、助教引导的协作解题、围绕统一量规的反馈讨论。相应地,学校还要提供有人支持的实验室和协作空间,包括纯线下空间或配备 AI-free、AI-limited 电脑的场地;否则增加实验、团队任务和当面评估只会停在课程设计文件里。
报告对“用更强的技术抓作弊”很警惕。AI 检测器不可靠,还可能把非英语母语者或神经多样性学生的写作误判为 AI 生成;MIT 的纪律委员会不把检测器输出单独当作学术诚信案件的足够证据。当前一代 lockdown browser 在报告看来容易出错、有监控感;在多数情况下,报告更倾向当面监考。它的思路是用更好的学习证据建立信任,尽量避免把课堂变成师生互相怀疑的地方。
但大学不只是课程:住宿制共同体也是学习基础设施
委员会听到了课后答疑、线上讨论以及宿舍、图书馆里的学习小组参与下降的反馈。报告明确把其中部分叙述标为 anecdotal(轶事性):它提示风险,却不能证明 AI 就是唯一或直接原因。AI 进入校园时,学生焦虑、孤独和人际疏离早已是更广泛的背景问题。
对 MIT 而言,面对面互动不是可替换的装饰。和同学一起拆解证明、反复调试实验、当面争论,既支持知识建构,也训练沟通、求助、协作与建立信任的能力。
因此,学校不只要解释住宿制教育为何重要,还要主动重建共同规范、共同仪式和支持系统。报告提出的例子包括跨群体讨论人生与职业选择、为面对面连接预留的 Tech Free Times,以及扩大共同阅读和讨论;教师和工作人员也要能识别 AI 加剧的学业、社交与情绪困难,并把学生转介到合适的支持渠道。与此同时,MIT 需要承认从热情、怀疑到拒绝使用 AI 的不同立场,并支持减轻训练数据、社会、环境等负面影响的研究与政策工作。
UROP(本科研究机会计划)是关键案例。报告称,它直接覆盖了 93% 的本科生和 58% 的教师。它不只让学生取得学分或薪酬,也让他们进入研究共同体:观察研究问题如何形成,判断力如何发展,错误如何被建设性地解释,功劳如何分配,分歧如何处理,知识又如何被集体生产。如果教师因效率而用 AI agent 取代本科研究助理,可能会保住短期研究产出,却失去研究作为学徒训练的教育价值。因此报告建议保护并扩大 UROP 等经历,让更多学生能够参与,并考虑把类似体验延伸到实验室以外。
最后建立治理:别把系统性改革留给单个教师
重设一门课的目标、评估和活动已经是大量工作,在全校范围持续更新,更不能依赖一批教师的个人热情。报告因此提出一组相互衔接的组织设计:
- 设立长期运作的 AI 与教育委员会,追踪校内外影响、技术变化与新证据,负责战略、评估和政策协调。
- 在各学院或院系设置 AI Leads,让课程改造和政策适配贴近学科。
- 资助 AI Fellows 与 AI Implementation Team,由技术、AI 与学习科学专长支持教师、开发校级工具,并研究工具在现场怎样被用、造成什么效果。
- 建立 AI Pilot Fund,为 AI 点数、助教、UROP、夏季支持等成本提供资源,既支持 AI-enabled 实验,也支持有意为之的 AI-free 学习体验。
- 用培训、同行分享和校内实践社群,让教师之间传递有效做法;同时跟踪 AI 使用、校园参与、学生满意度和毕业后反馈。
组织支持还包括公平的技术入口。报告指出,当时头部商业模型的高阶方案最高可达 200 美元/月,而研究者的 API 使用可能高得多。MIT 已运行 model-agnostic 的 Parley,为每位成员提供多模型访问和每月最高 30 美元的免费点数;报告同时承认,这对某些课程,特别是软件工程课,可能还不够。
“公平入口”也不只是给每个人一个聊天框。报告要求校级系统覆盖 agentic coding 和工作工具,并为需要训练或微调模型的课程提供足够的本地或云端算力;否则学生即使名义上都能访问 AI,实际能完成的任务仍会因经济条件和基础设施而分化。
公平访问和隐私不能分开。商业 AI 服务默认记录用户会话时,敏感课程数据或研究材料存在被纳入训练的可能;报告因此支持保持模型中立,并探索更多本地托管的开源模型访问。但校级平台又带来新问题:用户会向 AI 询问健康、关系、情绪和焦虑等私密内容,而教师又可能希望通过对话日志理解学习过程。谁可以看、保留多久、什么情况下可以干预,都需要公开、透明的日志与审计政策。
报告还要求 MIT 跟踪 AI 的财务与环境成本。训练和推理都消耗能源,数据中心还涉及用水、建设和硬件材料。企业数据不透明、成本分散在整个模型生命周期,意味着这些影响很难精确计算。委员会的建议是,公开不同模型的环境成本估算,审计学校自身的 AI 足迹,并投资更低能耗的方法。
26 项建议怎样带走
报告特别提醒,这 26 项建议不是可以彼此割裂、逐项打勾的待办,而是一组需要协同推进的改变:教育过程 10 项,人与共同体 6 项,持续治理 10 项。正文已经解释其中的关键关系;文末的“MIT AI 教育改革带走包”提供完整 26 条速查表,以及附录 B 的四种课程 AI 政策选择卡,均可直接复制 Markdown 或下载 .md 文件。
这份报告最可复用的,是一个能够迭代的教育系统
MIT 没有宣称找到所有大学的标准答案。“谦逊”是报告的第一原则,持续修正也被写入组织设计。它最有价值的部分,是把原本容易分散的决策连成一个闭环:
教育目标 → 评估证据 → 作业与课程政策 → 人际与组织支持 → 指标、反思与新一轮修正。
对中文教育实践者而言,这个顺序比照搬任何一条“禁用”或“必用”政策更值得参考。先把这门课真正要培养的能力说清,再判断什么必须由学生亲自完成,什么适合借力 AI,怎样用多种证据确认学习,最后让组织对资源、公平、隐私和长期影响负责。
这些建议有明确的适用边界。它们深度依赖 MIT 的高强度实作文化、研究型大学资源和住宿制社群;问卷的回复率与自选样本也限制了数据的外推。报告的最终边界同样保持张力:AI 可以让学生更高效、支持学习和科学发现,也会冲击学习过程、教学实践与住宿制教育的社会织理。人类智慧、连接、判断和亲身实作,正是这轮教育重设计需要优先保护的对象。
MARKDOWN TAKEAWAY
MIT AI 教育改革带走包
两份可直接复制或下载的 Markdown:26 项建议完整速查,以及四种课程 AI 政策选择卡。
当 AI 能完成作业,大学该教什么、怎么考?
当生成式 AI 迅速嵌入校园日常,高校面临的核心挑战并非技术本身,而是教学秩序与评估信任的瓦解。学生在遇到阻力时将思考全盘外包给算法,不仅直接削弱了批判性思维与记忆留存,更动摇了传统作业对真实掌握程度的证明力。
这一现实表明,AI 已非边缘辅助工具。然而调查同时揭示出鲜明反差:学生对认知外包(cognitive offloading)与技能退化深感焦虑,却普遍缺乏系统的 AI 伦理与批判使用训练。需要指出的是,问卷中 12% 的回复率存在自选样本偏差,但这些数据已足以构成警示大学必须采取系统性行动的早期信号。
核心破局:以终为始的课程“逆向设计”
面对作业可轻易代写的局面,修修补补的局限性规定已无济于事。报告明确提出,大学应超越“这门课要不要禁 AI”的被动设防,转向以教学目标为源头的“逆向设计”(Backward Design)工程。
课程政策光谱:告别一刀切与双向透明原则
学科差异要求灵活的政策边界。报告在附录 B 提炼出四类相互平行的政策模板,供教师按学习目标量体裁衣。制定政策的核心准则在于:规则必须陈述实质理由。禁止 AI 时需讲明其会捷径化哪个基础认知过程;鼓励 AI 时亦须界定其如何扩展学生能力边界。
双向透明是信任的基石:教师在作业设计与评语生成中同样必须披露 AI 介入程度,绝不能以机械自动化反馈敷衍学生的真实投入;而在学术研究中,AI 严禁被列为论文共同作者,人类研究者对所有产出准确性负最终法律与学术责任。
评估体系重构:从课后答案到多维证据链
MIT 标志性的 P-Sets 计算题库正面临机器生成的高效瓦解。单凭课后提交的一纸正确答案,已无法作为个人真实理解的充分判据。重构评估并非退化为更大密度的限时笔试,而是构建复合证据链:
技术作弊防控的边界反思:报告强调不可迷信“AI 检测器”与锁屏浏览器。当前检测工具存在严重误判风险,且对非英语母语者和神经多样性学生存在系统性偏见;MIT 纪律委员会明确规定不将检测器输出单独作为学术违纪凭据。学校应更重当面监考与基于证据的学术信任,避免校园陷入军备竞赛般的相互猜忌。
不可替代的底座:住宿制学徒制与组织治理
大学绝不仅是知识传授的流水线。线下答疑、宿舍研讨与共同攻关构成了不可替代的社交学习基础设施。尤其是直接覆盖 93% 本科生与 58% 教师的 UROP(本科研究机会计划),其核心是长周期的学术学徒制。若教师因追求短期论文发表效率而以 AI agent 取代本科生研究助手,虽获眼前产出,却将摧毁科研人才梯队的培育土壤。