Google 让老师一句话生成互动练习:Gemini 做界面,四类自动检查兜底,老师最后把关
老师给出学科、年级和主题,Gemini 生成带关卡、提示和反馈的网页模拟;一次生成只有 3.5% 能过全部检查,自我纠错 10 轮后到 69.3%。目前还没有学生学习效果的数据。
从在线课本到视频库,数字教育工具虽然改变了学生获取信息的方式,但很多时候数字学习仍然像是一种被动体验。学生坐在屏幕前点击「下一页」,看起来在学习,思维其实处在被动接收状态。
认知科学领域著名的 ICAP 框架——将学习行为由浅入深分为被动(Passive)、主动(Active)、建设性(Constructive)和互动性(Interactive)四个层级——早就证实,能够动手操作、调整变量并观察即时反馈的「互动式学习」,在建立概念模型和长期记忆上的效果远好于被动听讲。类似物理仿真实验那样的互动工具,以往大多需要专业的开发团队写代码定制,不仅周期长、成本高,而且老师很难根据自己当天的授课进度微调变量。
Google Research 的「学习互动练习(learning interactives)」实验让老师输入学科、年级和教学主题,再由 Gemini 生成包含关卡、操作控件、数据图表和反馈的网页模拟。
把近年来在前端领域崭露头角的「生成式界面(generative UI)」——让 AI 根据对话意图动态构建界面组件而非调用预写静态代码的技术——直接搬进教育场景,并没有想象中顺利。配套的技术报告给出了一个很直观的数字:即使前面的教学规划都已做好,界面一次生成只有 3.5% 能通过全部检查。
为什么不能直接拿现成的生成式界面来教书
按报告的说法,现成的生成式界面主要擅长做一次性的小部件(widget-like components),不擅长多阶段、有结构的教学模拟。
放进课堂,直接让大模型「写一个物理实验界面」还会撞上两堵墙:
第一堵墙是认知卸载(cognitive offloading)。大语言模型原本的设计目标是帮用户省事,用最省力的方式给出答案。然而学习过程恰恰需要合理的「认知阻力」——学生必须自己经历推导、试错、碰壁和调整,才能真正理解知识背后的机制。如果 AI 做出来的界面过于智能直接把解题捷径拱手相送,学生就会把思考过程外包给机器,表面上完成了操作,大脑却没有完成知识构建。与此同时,认知研究表明完全不给引导的「纯发现式学习」基本无效(Kirschner、Sweller、Clark 2006),主动学习需要明确的脚手架和引导,而这在课堂上本来是由老师承担的。
第二堵墙是动态仿真的物理与教学严谨性。一个合格的教学互动练习,必须保证后台逻辑遵循准确的科学规律,界面上的数值滑块能实时反映到曲线图上,同时关卡的目标在数学和物理上必须是「存在可行解」的。常规的生成式大模型在写代码时,极易产生各种隐蔽瑕疵:例如报告中记录的一个化学互动练习,虽然基本布置没有问题,但放烧瓶的桌子超出了画面边框,数据读数面板还挡住了部分模拟物件;更严重的是,关卡目标可能根本达不到。
因此,这套系统没有让模型用一条提示词直接交付成品,而是把教学设计、代码生成和验证拆开。
四个阶段拆解:把教学大纲变成关卡游戏
为了让生成的界面具备教学价值,研究团队将构建流程拆解为四个前后衔接的阶段,在文本规划、关卡设计、代码实现与教学辅导之间筑起一道道防护栏。
在整套流程中,教师始终处于主导与把关的核心位置:流程由老师发起请求(包含学科、年级、主题,并可附加额外要求);随后,AI 生成具体的学习目标,交由老师审核并可自由修改;针对通过的目标,系统为每个请求生成 5 个候选模拟,按报告的设计由老师挑出最符合教学意图的一个(在 12 位教师的实测研究中,则先由内部评审挑出最佳版本再呈现给老师);新生成的练习最终必须经老师审核通过后,才能正式进入公开库。
据技术报告图 4 重绘
一个互动练习是怎么做出来的:四个生成阶段,每一步都要过检查
- 老师 发起请求 学科、年级、主题,可附额外要求
-
1
模拟构想 先写学习目标(老师审核、可修改),再写模拟方案:有哪些实体、它们之间的关系、要显示的读数和图表、学生能调的旋钮和按钮 自动评估 · 不过就带着意见重做
-
2
分级关卡 5 个关卡目标逐关生成,每关要具体、好懂、比上一关多一点新东西、又不能难太多 每关单独检查 · 不过就重写这一关
-
3
生成界面 写出 HTML 和 JavaScript,在 Chrome 里实际打开,按四类检查:
- 可解性
- 读数图表
- 操作机制
- 视觉
-
4
辅导内容 开场导览、每关的分层提示和完整解法、答对答错时的解释反馈 自动评估 · 不过就重做
- 老师 挑选与审核 每个请求生成 5 个候选,老师挑最合适的;审核通过才进公开库,不通过就退回
阶段一:模拟构想(Simulation idea)。这一阶段完全基于文本进行。老师输入学科、学段和具体题目(例如高中物理的复杂直流与交流电路)。Gemini 首先梳理出一组精确且可测量的学习目标,交由教师审核确认。在明确了「这节课究竟要达成什么认知」之后,模型才会进一步构思具体的模拟场景:有哪些实体对象(如脉冲整形器、谐振器)、实体之间存在什么科学规律、需要显示哪些读数和图表、留给学生操作的调节旋钮有哪些,以及最终的触发动作是什么。
阶段二:脚手架关卡(Scaffolding)。有了实验场景,不能直接把学生丢进一个毫无指引的沙盒。系统会让模型把核心概念拆解为 5 个具有阶梯难度的连续关卡。为了避免难度跳跃过大或目标含糊不清,这 5 个目标不是一次性生成的,而是采用逐关递进的方式:前一关的目标通过验证后,再生成下一关,严格要求每一关既要比前一关引入更深入的思考,又不能脱离前置概念的支持。
阶段三:界面代码构建(Gen-UI)。在前两个阶段的教学目标完全锁定的基础上,Gemini 开始编写 HTML 和 JavaScript 代码,把抽象的关卡和控制逻辑转化为能够在浏览器里运行的交互界面。这一阶段是技术实现上最脆弱、最容易出错的瓶颈。
阶段四:教学辅导与反馈(Guidance)。当界面本身能够正常运行后,系统才会为其追加外围的助学系统。这套系统包括帮助学生熟悉操作的开场导览(Tour)、藏在右侧工具箱里的公式与理论参考、遇到困难时按需点击的分层提示,以及学生尝试成功或失败时的针对性反馈弹窗。

在这套界面里,系统融入了两项关键的学习支持机制:
脚手架式提示(Scaffolded hints):按学生解题卡壳的程度逐层给出渐进式线索。例如提示会把学生引向相关公式,或解释某个特定术语;提示分为多个层级,只有在学生自己探索之后,最后才会提供完整解法(worked solutions),避免直接给出答案打断主动思考。
形成性反馈(Formative feedback):在学生操作出错或达成目标时,针对当前参数的组合原因进行原理解释。例如在数轴对称练习中成功通关时,弹窗不仅判定过关,还会具体解释:蓝车在 +6,对称位置就是 -6,两车离零点都是 6 个单位。根据老师反馈,答错时也给解释性反馈这项功能是研究后来才加上的(报告 3.1 节),帮助学生在试错过程中修复认知偏差。
从 3.5% 到 69.3%:代码生成里的自动对抗与自我迭代
在第三阶段(前端代码生成)中,测试数据显示:即使学习目标、模拟构想和关卡规划已经过充分验证,完全不经过反馈检查的单次模型直出,通过所有技术与教学标准的比例只有 3.5%。
按这套检查标准,一次生成的成品绝大多数都有至少一项不过关。为了解决这个问题,研究团队设计了一套多维度的自动检查机制(Auto-rater),让代码在 Chrome 里实际打开并接受四个维度的审查:
- 视觉表现(Visual):画面有没有超出边框、元件互相遮挡(比如数据面板挡住实验物件),或者多出会分散注意力的多余元素。
- 操作机制(Mechanics):按钮、滑块这些控件能不能正常用。
- 数据读数(Telemetry):检查界面上的实时读数和图表(例如展示 RC 电路瞬态电压与电流变化的实时曲线)。
- 可解性验证(Solvability):这是技术上最特殊的一环。系统会派出专门的测试 Agent 打开浏览器,像人类学生一样去操作那些旋钮,甚至刻意把参数拉到极端值进行对抗性测试,以此验证当前的关卡目标是否真的能够在现有界面下被成功解出。
如果任何一项检查不达标,检查意见就会作为反馈交回模型,按意见修改后再查,循环到全部过关(检查依据既包括生成的代码,也包括代码在 Chrome 里实际渲染出的画面)。
在前置目标已经验证的情况下,界面的综合通过率从第 1 轮的 3.5% 提高到中段的 28.9%,经过 10 轮迭代后达到 69.3%。
不同检查项的变化并不完全同步:
- 数据读数通过率:从初始的 23.3% 稳步提升至 93.5%;
- 操作机制通过率:从初始的 67.0% 提升至 98.2%;
- 视觉排版通过率:从初始的 47.8% 提升至 84.7%;
- 关卡可解性通过率:经历了 85.5% → 72.9% → 87.9% 的曲折变化。
可解性在中途出现下滑,反映出互动练习各部分相互牵连,各项改进并不单调(改好一处可能碰到另一处)。通过自动化环境进行端到端的真实验证,能够在交付老师审核前及早筛除大量隐蔽缺陷。
数值取自技术报告图 5、图 6
自我纠错前后:界面通过各类检查的比例
前提是模拟构想和关卡目标都已验证,只统计「生成界面」这一步。每组三条依次是第一次生成、中途、最后一次(约 10 轮改进后)。
全部检查都通过综合通过率
可解性关卡能不能被解出来中途反而下降
读数图表实时读数和曲线
操作机制按钮滑块能不能用
视觉越界、遮挡、多余元素
教师与专家怎么评价:理化容易出彩,生物偏向翻页
为了验证这些互动练习的实际成色,研究团队开展了两组由一线教师参与的评估。
第一组评估面向 12 名美国在职 STEM 教师。每位教师根据自己班级的教学需求提交了 3 个定制主题,系统共接收了 36 个生成请求。老师们拿到的学习目标绝大多数原样通过,要求改的也都是小改动。在后台,系统为每个请求生成 5 个候选方案,由内部评审挑出质量最高的一个呈现给老师。在这 36 个请求中,有 3 个因为未能达到基本质量标准被内部直接淘汰,最终展示了 33 个。
参与测试的教师对这批模拟的可用性(usability)打分全部在 7 分及以上,平均高于 8.1 分(满分 10 分。博客把它概括成老师给「质量」平均打 8 分,报告原文评的是可用性)。老师们在定性反馈中普遍提到,这套工具最大的价值在于能做差异化教学(按不同学生调整)。以往现成的教学模拟大多是定死的软件,老师面对不同接受能力的学生无法调整参数和坡度;而这套系统可以按班级节奏量身定制,内嵌的分层提示也缓解了教师在课堂上一对一辅导分身乏术的窘境。几位老师在研究中也指出了当时的不足:需要把请求和课程标准对齐;也有老师指出当时缺少对错误尝试的解释性反馈(后来已补上)。
第二组评估则针对 40 个由教学专家设定的 STEM 课题,涵盖从小学高年级到大学本科的跨度。每个顺利通过自动化检查的互动练习,均交由两位教授该学科的英国专业教师独立评审。在严格的验收标准下,互动练习的整体通过率达到了 86%,各细分指标大多落在「良好」或「优秀」区间。

学科之间的效果差异很明显:
物理与化学表现最突出。无论是碰撞定律、抛体运动还是理想气体方程,其核心概念天然依赖严密的数学公式与连续数值变量,非常契合「滑动旋钮调整参数、观察图表动态响应」的模拟机制,评分最接近「优秀」。
生物学科表现最弱。在界面的交互体验和美观度上,生物练习的评分显著落后。原因在于像细胞周期、中心法则等中学生物知识,往往以定性机制和形态记忆为主,缺乏连续的数学控制方程。模型在生成这类内容时,很难找到自然的交互隐喻,最后很容易退化成把静态概念分步陈列的「翻页课本」,失去了真正互动的趣味。
这些分数衡量的是软件可用性和教学契合度,项目还没有学生在真实课堂中的学习收益数据。它能否提高考试表现或加深概念理解,需要后续课堂研究回答。
老师和学校现在能用到什么
目前,这项实验已经在 Google Research 网站上线了公开样例库(需登录 Google 账号后查看)。

库中目前收录了 36 个经过教师逐一审核通过(标有「Vetted by teacher」)的成品互动练习,包括开普勒行星运动定律、具有误导性的数据图表识别、火箭滑车运动学等。所有内容都是英文,以初高中的理科和数学为主,也有一个小学题目和几个计算机题目。
对于想要尝试定制教学的学校,使用 Google Workspace for Education 的教育机构可以申请加入 Google for Education 的试点计划。参与试点的教师可以向系统提交个性化的课程标准与主题,等待系统生成。但系统并不允许未经验证的代码直接流向学生:新生成的互动练习必须先交由提交申请的老师本人体验并审核通过后,才会被正式收录并开放使用。
下一步是通过 Google for Education 试点,在真实课堂中验证学生的学习效果。
给生成式界面装上「认知刹车」:从 3.5% 到 69.3% 的互动教学实验
认知科学领域的 ICAP 框架早已证实:能够亲自动手操作、调整变量并实时观察反馈的「互动式学习」,在建立概念模型和长期记忆上的效果远胜于被动听讲。然而,将当下流行的「生成式界面(Generative UI)」直接搬进课堂,会立刻撞上两堵坚硬的高墙:
其一是认知卸载(Cognitive Offloading)。大语言模型的设计初衷是替用户省力,但学习本质上需要合理的「认知阻力」——学生必须自己推导试错,才能构建心智模型。若 AI 生成的界面过于智能、直接把捷径送至眼前,学生就会把思考外包给机器;其二是仿真严谨性,直接让大模型写复杂科学模拟,极易产生画面溢出、面板遮挡物件,甚至关卡目标在物理规律上根本不可解的严重缺陷。
技术报告证实:即使前面的教学规划都已做好,界面一次生成只有 3.5% 能通过全部检查。 纯粹依赖单次提示词,生成的只会是不可控的半成品。
为破解生成品质不可控的难题,研究团队放弃了「一步到位写代码」的粗暴做法,将构建流程拆解为四个前后衔接的阶段,把教学大纲转化为可严密解出的关卡游戏:
完全基于文本。教师输入学科、年级与主题后,Gemini 梳理出一组精确且可测量的学习目标,交由教师审核。明确「要达成什么认知」后,再构思实体对象、科学规律、仪表图表与操作旋钮。
拒绝把学生丢进无指引沙盒。系统将核心概念拆解为 5 个阶梯难度的连续关卡,前一关验证通过后再生成下一关,严格确保每一关既引入更深思考,又依赖前置概念支撑。
在教学目标完全锁定的基础上,Gemini 开始编写 HTML 与 JavaScript 代码,把抽象关卡和控制逻辑转化为浏览器交互界面。这是技术上最脆弱、最易报错的瓶颈环节。
代码跑通后追加外围系统:按需提供「分层渐进提示(Scaffolded hints)」,仅在探索后才给完整解法;搭配「形成性反馈(Formative feedback)」,在成败瞬间针对参数组合解释科学原理。
在代码构建阶段,系统并非静默等待,而是在真实的 Chrome 浏览器中运行多维自动检查。若有任何一项不达标,意见便回传模型迭代修改:
检测画面是否超出版面、面板是否遮挡实验器材、是否存在分散注意力的多余元素。
验证滑块、旋钮与触发按钮能否正常响应事件与状态变更。
检查界面上的实时读数和曲线图(例如 RC 电路的瞬态电压与电流曲线)。
派出专属测试 Agent 模拟人类学生转动旋钮,刻意把参数拉至极端值,对抗验证关卡目标是否真正存在数学可行解。
完全不经过反馈检查的单次模型直出,技术与教学全通率仅为 3.5%。引入 Chrome Auto-rater 之后,通过多轮代码重写与对抗审查,综合通过率在中段尝试升至 28.9%,最终在 10 轮自我迭代后达标至 69.3%:
在 12 位美国在职 STEM 教师的定制实测(36 个请求中 33 个交给老师,可用性评分全部 7 分以上、平均高于 8.1,满分 10)以及 40 个横跨小学至大学课题的专家评审(每个练习由两位学科老师评分,验收通过率 86%)中,实验呈现出剧烈的学科适应性分化:
碰撞定律、抛体运动、理想气体方程等核心概念天然依赖严密的解析公式与连续数值变量。学生「滑动旋钮、调大加速度、观察曲线联动」的隐喻非常自然,仿真与关卡验证高度契合。
细胞周期、中心法则等中学生物知识大多以定性过程和形态记忆为主,缺乏连续控制方程。AI 难以设计出生动的交互操作,极易退化成分步展示概念的「翻页课本」,失去互动模拟的探索乐趣。