一种更廉价的辅导策略测试方式
自适应AI导师的优劣,取决于用来构建它们的反馈质量。当研究人员能够看出哪种解释能帮助陷入困境的学习者、哪种解释会让其继续卡住时,导师才会进步。这个循环通常需要真人参与:学生解题、犯错、接收提示,然后要么自我纠正,要么再次失败。大规模运行这样的循环成本高昂,而StudentSim背后的研究人员认为,这种成本已成为阻碍辅导系统发展的主要障碍。
他们的解决方案是模拟学习者。StudentSim由微软与伊利诺伊大学合作开发,它为研究中的每一位学生构建一个独特的数字复制体,然后在调整导师时用这些复制体代替真人。由于复制体即时响应且运行成本几乎为零,研究人员可以测试远超课堂研究所能允许的辅导策略。论文作者将目标描述为:为AI导师提供一条快速、低成本的反馈通道,取代目前所依赖的缓慢且昂贵的通道。
两种从未被结合的能力
研究人员认为,早先对学生建模的尝试只解决了一半问题。根据他们的分析,现有系统往往落入两个阵营之一,而每个阵营都缺少某些关键要素。
- 行为复制体:这些模型在真实学生数据上训练,能以合理准确度重现特定学习者的答案,包括该学习者常犯的错误。但它们无法对导师的解释作出反应。
- 提示式语言模型:这些是通用模型,被指示像学生一样行事。它们愿意遵循提示,并按要求修改答案,但并不真正像它们所应代表的学习者。
AI导师需要同时具备这两种特性。它需要一个现实的起点,即一个会像真实学生那样因同样原因做错同样题目的复制体。它还需要该复制体在获得帮助时改变想法。一个从不进步的学生无法说明提示是否有效,而一个因错误原因而进步的学生则会产生误导性证据。
将两种特性转化为可衡量的目标
StudentSim将每种特性视为需要优化的分数,而非模糊的愿望。一项指标衡量复制体的答案与真实学生答案的匹配程度,包括错误在内。另一项指标衡量复制体在导师介入后修改答案的意愿程度。这两项指标共同定义了模拟学生对导师训练而言“有用”的含义,而不仅仅是对话中听起来合理。

瓶颈:每位学生的数据几乎为零
团队面临的最严峻约束是数据稀缺。他们的英语写作数据集鲜明地说明了这一问题:中位数学生仅写过三篇文章,超过三分之二的学生写过五篇或更少。将复制体直接拟合到如此小的样本上并不可行。样本如此之少,模型会记住眼前的具体文章,而不是学到关于作者的任何普遍特征,研究人员将这种失败模式称为过拟合。
这就形成了一个两难局面。仅用一名学生的少量提交内容训练出的模型过于脆弱,难以信任;但要从每个人那里收集足够多的作品来训练可靠的复制体,又意味着要收集该系统本就是为了避免需要而设计的数据。换言之,数据稀缺问题无法通过简单地要求更多学生提交内容来解决。
两阶段训练进一步利用有限数据
第一阶段:学习学生的共性
第一阶段通过汇总来绕开稀缺问题。基础模型在某一学科所有学生的作品合集上训练,学习在整个群体中成立的模式:学习者常犯的错误,以及他们在导师给出提示后倾向于修改答案的方式。这一阶段提供了关于该领域内学习表现的一般知识。
第二阶段:适配到个人
第二阶段进行个性化。从汇总的基础模型出发,系统利用某个人留下的少量记录(例如三篇文章)适配到单个学生。由于模型已经广泛理解了该学科,个人数据只需将其微调至某位特定学习者的倾向,而不必从头教起。
其结果是可以为数据集中几乎每一位学生构建复制体,而不仅仅是那些提交了足够作品、足以单独训练模型的 prolific 学生。对于评估研究而言,这一点至关重要。一个只对班级中最活跃的三分之一学生建模的系统,会扭曲导师在全部学习者范围内的表现图景。

在国际象棋与写作领域进行测试
研究人员在涵盖多个学科的60名学生身上验证了该方法,包括国际象棋和英语写作。这两个领域以不同方式考验系统。国际象棋提供逐步记录,且对错分明;而写作则要求对论点、结构和修改作出判断。在这些场景中,目标是证明复制体既能模仿学生的典型错误,又能像该学生那样对指导作出回应。
这两项要求对训练循环都至关重要。如果复制体只是忠实重现错误却忽略提示,导师就无法获得关于其解释是否有帮助的信号。如果它对每条提示都热情回应,却从不真正像实际学习者,那么所得测量结果就无法说明部署后的导师最终会遇到的学生情况。
为何这不止关乎一篇研究论文
AI辅导因承诺为每位学习者的薄弱环节量身定制教学而吸引了大量投资,但个性化取决于关于“什么对谁有效”的证据。如果证据管道因招募学生的成本而受阻,那么进展就会受预算限制。模拟学生提供了一种方式,可以弥合大语言模型快速进步的能力与建立在其之上的、进展较慢的辅导系统之间的差距。
- 辅导策略的比较可以快得多,因为复制体在几秒内而非几周内生成反馈。
- 研究人员可以开展在真实学习者参与下不切实际或存在伦理顾虑的实验。
- 不寻常的学生,包括那些具有非典型错误模式或记录作品极少的学生,变得可测试,而非被忽视。
- 评估可以覆盖整个班级,而不是恰好提交作品最多的少数学生。
该设计中也隐含局限。复制体会继承汇总数据中存在的任何缺口和偏差,而模拟学习者只能与其塑造所用的记录一样忠实。一名由三篇文章代表的学生,无论模型适配得多么巧妙,仍然只是由三篇文章代表。
论文自身的框架提出了该领域的下一个问题:证明针对模拟学生测得的改进能够迁移到这些学生所应代表的课堂中。在证明这种迁移之前,StudentSim最好被理解为一种加速寻找更好辅导方式的手段,而不是它所模仿的学习者的替代品。
本文基于The Decoder的报道。阅读原文。
Originally published on the-decoder.com





