个性化学习真的胜过标准化教学吗?
每一个教育平台都在承诺个性化,而它们几乎全都引用同一个来自 1984 年的数字。那个数字站不住脚。底下的故事更有用:「个性化」把三件相当不同的事打包在了一起——一件有效,一件中等,还有一件已经被明确推翻。
每一个教育平台都在承诺个性化,而它们几乎全都引用同一个来自 1984 年的数字。那个数字站不住脚。底下的故事更有用:「个性化」把三件相当不同的事打包在了一起——一件有效,一件中等,还有一件已经被明确推翻。
如果你读过任何一个学习平台的宣传,你几乎一定见过这个数字:一对一辅导能把学生推到常规课堂教学之上两个标准差——也就是把一个中等学生送进前 2%。
这个数字是真的。它来自 1984 年的本杰明·布卢姆(Benjamin Bloom),并且成了整个行业的道义基础:如果辅导有这么大的威力,那么用机器给每个人配一位导师,显然是刻不容缓的事。

麻烦在于,这个数字站不住脚。而取代它的东西,要有用得多。
布卢姆的结果来自少数几项小型研究:受过精心训练的辅导员,很短的内容单元,理想条件,而且用与那些内容直接绑定的测验来测量。
当库尔特·范莱恩(Kurt VanLehn, 2011)把整个辅导文献综述一遍时,他得到的数字要温和得多:人类辅导产生的效应量约为 0.79,而——这才是值得注意的地方——基于计算机的智能辅导系统约为 0.76。
两个结论一起到达。第一:两个标准差是海市蜃楼,真实数字接近 0.8,仍然很大,但已经是另一个量级的主张了。第二,也更令人高兴:机器已经接近人类。人类导师和好软件之间的差距,远小于「有辅导」和「没有辅导」之间的差距。
关于这件事的争论大多毫无进展,因为双方用同一个词指的是不同的东西。至少存在三种个性化,而它们各自的证据强度差别极大。
第一种:个性化进度与掌握。没掌握的人继续练,掌握了的人往前走。这叫掌握学习(mastery learning),库利克等人(Kulik et al., 1990)的元分析把效应量放在 0.5 左右。它是证据最充分的一种个性化,也是最不炫目的一种。
第二种:个性化难度与题目顺序。系统追踪你做错了什么,然后决定接下来给什么。智能辅导系统的元分析落在 0.4 到 0.7 之间。一项 2019–2024 年自适应系统的近期综合研究,报告相对于非自适应对照约为 0.70——而另一项专门针对阅读的研究,得到的是约 0.29。
0.29 与 0.70 之间的距离,本身就是故事:有效性高度依赖学科、实施质量,以及对照组究竟得到了什么。
第三种:按「学习风格」个性化。视觉型学习者给图片,听觉型学习者给音频。这是最广为人知的版本,而它已被推翻。帕什勒等人(Pashler et al., 2008)梳理了文献,没有找到支持那个关键主张的可信证据:让教学方式匹配学习者的风格能改善结果。人确实有偏好;但那些偏好并不能预测什么方式最能教会他们。
简单说:按你现在在哪做个性化,有效。按你喜欢什么做个性化,无效。
这是问题的另一半,通常会被跳过。
当一个自适应平台与「传统教学」相比较时,结果极大地取决于那个传统教学有多好。跟一堂糟糕的讲授课比,几乎什么都能赢。
但做得好的标准化教学,背后有很强的证据。斯托卡德等人(Stockard et al., 2018)综合了半个世纪关于直接教学法(Direct Instruction)的研究——一套高度标准化、有脚本、面向全班的课程——发现在各学科、各学生群体中都有可观且一致的正面效应。
这把图景复杂化了,而且是有用的复杂化。如果一套设计良好的标准化课程同样能产生 0.5 左右的效应,那么个性化的真实优势就比宣传的要窄——而且它必须为高得多的成本作出辩护。
兰德公司(RAND)对大规模实施个性化学习的学校所做的研究,得到的是正面但温和的结果,并且明确提示了研究设计上的保留。诚实的解读是:它有效,它不是魔法,而实施质量解释了绝大部分的差异。
三个因素几乎解释了全部的离散。
被个性化的是什么。调整难度有扎实的理论基础——它让学习者停留在既不无聊也不崩溃的那个区间。调整界面颜色或媒体格式则没有。
对照组拿到了什么。很多研究把一个自适应系统和「普通家庭作业」相比——但那个系统同时还提供即时反馈、更多练习和更多提取。这种情况下你测的不是自适应,你测的是练习量。
以及它是怎么被实施的。一个平台只有在学习者真的用得够多、而且底层模型足够好时才能适应。大量令人失望的研究,说到底就是学生每周只用了二十分钟。
个性化是昂贵的。它需要数据、软件、教师培训和时间。
与此同时,有几项完全不个性化的干预,几乎不花钱就能产生有意义的效应。把复习间隔开而不是集中在一起(塞佩达等人,2006)对所有人都有效。用自测代替重读也是。交错练习不同题型同样是。
这个比较值得在投资之前先做一遍:如果你可以应用三条免费的普适原则,或者买一套昂贵的自适应系统,合理的顺序是先把免费的做掉。
以上都是关于学校的。如果你在自学一门语言,图景会以一种有意思的方式移动:你本身就已经是一个自适应系统。
你知道自己会忘掉哪些词。你知道自己在哪里会卡住。你不需要一个算法来告诉你。唯一的问题是,你会不会照着它行动——还是继续复习那些你已经会的东西,因为复习已知的感觉更舒服。
而且有一种已被证实的个性化形式,便宜且现成:间隔重复。一套好的卡片系统会依据你的实际表现调整间隔——难的卡片更早回来,容易的卡片飘得更远。这恰好是第一种和第二种个性化的合体,而且人人都够得着。
对自学者来说,由此得出三条原则:
个性化难度,不要个性化形式。把材料调整到你能力的边缘上,有效。因为自认是「视觉型学习者」而改看视频,无效。
让数据决定,不要让感觉决定。流畅是个糟糕的指标。算数的是它能不能撑过一周——而这恰恰是间隔系统在替你测量的东西。
还有,不要把标准化的部分丢掉。一门结构完整的课程、一份分级词表、一条合理的语法序列——这些标准化的东西之所以存在,是因为它们管用。个性化应该是叠加在一个好框架之上的一层调整,而不是「有没有框架」的替代品。
个性化胜过标准化教学吗?胜过,但幅度远小于宣传,而且只有在个性化了正确的东西时才成立。
把进度和难度调整到学习者的真实水平:有证据,效应中等,值得做。按偏好和「风格」调整:没有证据,而且已经被检验得足够彻底,可以有底气地这么说。
那个「两个标准差」应该退休了。但取代它的发现,对任何一个独自学习的人来说更令人振奋:好导师和好系统之间的差距很小,而「有系统」和「什么都没有」之间的差距很大。对一个孤身的学习者来说,这是好消息。
同样的内容,用浅白的话再讲一遍——写给年纪小的读者,也写给想快点抓住要点的人。
只要读过任何一个学习平台的宣传,你几乎一定见过这个数字:一对一辅导能把学生推到普通课堂教学之上两个标准差——把一个平均水平的学生送进前 2%。
这个数字是真的。它出自 1984 年,并成了整个行业的道义基石。
麻烦在于它站不住。而取代它的那个结论,要有用得多。
那个结果来自几项小型研究:受过精心训练的辅导者、很短的内容单元、理想条件,而且用的是与那部分内容直接绑定的测验来衡量。
当整片辅导文献被系统检视时,数字谦逊得多:真人辅导的效应约为 0.79——而值得注意的是,计算机辅导约为 0.76。
两个结论一起到来。两个西格玛是海市蜃楼。而机器在辅导这件事上已经接近人:真人导师与好软件之间的差距,远小于「有辅导」与「什么都没有」之间的差距。
关于这件事的争论大多没有结果,因为双方用同一个词指着不同的东西。至少有三种,而它们的证据差得极远。
你本来就知道自己忘的是哪些词。你知道自己在哪里卡住。你不需要一个算法来告诉你。唯一的问题是,你会不会照着做;还是继续复习那些早就会的东西,因为复习已知的感觉更舒服。
而有一种被证明有效的个性化,既便宜又现成:间隔重复。一个好的系统会按你真实的表现调整间隔——难的卡片更早回来,容易的往后飘。那正是节奏与难度的合体,人人够得着。
个性化能胜过标准化教学吗?能——但远不如广告里说的那么多,而且只有在个性化了对的东西时才成立。
两个西格玛这个数字该退休了。但取代它的发现,对自学的人更提气:好导师与好系统之间的差距很小,而有系统与没系统之间的差距很大。
这些文章综合了学习科学与语言学中公认的研究成果。主要来源与延伸阅读:
这个问题预设了专注是一块练了会变大的肌肉。最扎实的证据说,练出来的部分几乎搬不走,而真正变好的一份来自减法——从那个你感觉...
没时间、没天分、年纪大了——这些是解释,不是原因。真正量得出来的要乏味得多:一句带时间、带地点、带第一个动作的话,而还没有...
不是一件事,而是四件,跑在相差十亿倍的钟上:400毫秒处的一个波、一夜之间被锁住的一个词、几个月里收窄的激活范围、几年里改...