← 学习科学

个性化学习真的胜过标准化教学吗?

每一个教育平台都在承诺个性化,而它们几乎全都引用同一个来自 1984 年的数字。那个数字站不住脚。底下的故事更有用:「个性化」把三件相当不同的事打包在了一起——一件有效,一件中等,还有一件已经被明确推翻。

AI Aggregated source· 2026年8月2日· 7 分钟阅读 ·Teaching

如果你读过任何一个学习平台的宣传,你几乎一定见过这个数字:一对一辅导能把学生推到常规课堂教学之上两个标准差——也就是把一个中等学生送进前 2%。

这个数字是真的。它来自 1984 年的本杰明·布卢姆(Benjamin Bloom),并且成了整个行业的道义基础:如果辅导有这么大的威力,那么用机器给每个人配一位导师,显然是刻不容缓的事。

一台木制台式机器,窗口显示题目,旁边有输入答案的旋钮。
斯金纳的教学机器,约1960年——一名学习者、一次一题、即时反馈、自定进度。个性化教学被许诺、制造并推销了六十多年,这值得在读下一家平台的宣传册之前记起来。来源: Silly rabbit — CC BY 3.0, Wikimedia Commons

麻烦在于,这个数字站不住脚。而取代它的东西,要有用得多。

那两个标准差后来怎么了

布卢姆的结果来自少数几项小型研究:受过精心训练的辅导员,很短的内容单元,理想条件,而且用与那些内容直接绑定的测验来测量。

库尔特·范莱恩(Kurt VanLehn, 2011)把整个辅导文献综述一遍时,他得到的数字要温和得多:人类辅导产生的效应量约为 0.79,而——这才是值得注意的地方——基于计算机的智能辅导系统约为 0.76

两个结论一起到达。第一:两个标准差是海市蜃楼,真实数字接近 0.8,仍然很大,但已经是另一个量级的主张了。第二,也更令人高兴:机器已经接近人类。人类导师和好软件之间的差距,远小于「有辅导」和「没有辅导」之间的差距。

「个性化」不是一件事

关于这件事的争论大多毫无进展,因为双方用同一个词指的是不同的东西。至少存在三种个性化,而它们各自的证据强度差别极大。

第一种:个性化进度与掌握。没掌握的人继续练,掌握了的人往前走。这叫掌握学习(mastery learning),库利克等人(Kulik et al., 1990)的元分析把效应量放在 0.5 左右。它是证据最充分的一种个性化,也是最不炫目的一种。

第二种:个性化难度与题目顺序。系统追踪你做错了什么,然后决定接下来给什么。智能辅导系统的元分析落在 0.4 到 0.7 之间。一项 2019–2024 年自适应系统的近期综合研究,报告相对于非自适应对照约为 0.70——而另一项专门针对阅读的研究,得到的是约 0.29。

0.29 与 0.70 之间的距离,本身就是故事:有效性高度依赖学科、实施质量,以及对照组究竟得到了什么。

第三种:按「学习风格」个性化。视觉型学习者给图片,听觉型学习者给音频。这是最广为人知的版本,而它已被推翻帕什勒等人(Pashler et al., 2008)梳理了文献,没有找到支持那个关键主张的可信证据:让教学方式匹配学习者的风格能改善结果。人确实有偏好;但那些偏好并不能预测什么方式最能教会他们。

简单说:按你现在在哪做个性化,有效。按你喜欢什么做个性化,无效。

而「标准化」也不是一个稻草人

这是问题的另一半,通常会被跳过。

当一个自适应平台与「传统教学」相比较时,结果极大地取决于那个传统教学有多好。跟一堂糟糕的讲授课比,几乎什么都能赢。

做得好的标准化教学,背后有很强的证据。斯托卡德等人(Stockard et al., 2018)综合了半个世纪关于直接教学法(Direct Instruction)的研究——一套高度标准化、有脚本、面向全班的课程——发现在各学科、各学生群体中都有可观且一致的正面效应。

这把图景复杂化了,而且是有用的复杂化。如果一套设计良好的标准化课程同样能产生 0.5 左右的效应,那么个性化的真实优势就比宣传的要窄——而且它必须为高得多的成本作出辩护。

兰德公司(RAND)对大规模实施个性化学习的学校所做的研究,得到的是正面但温和的结果,并且明确提示了研究设计上的保留。诚实的解读是:它有效,它不是魔法,而实施质量解释了绝大部分的差异。

为什么各项研究彼此分歧这么大

三个因素几乎解释了全部的离散。

被个性化的是什么。调整难度有扎实的理论基础——它让学习者停留在既不无聊也不崩溃的那个区间。调整界面颜色或媒体格式则没有。

对照组拿到了什么。很多研究把一个自适应系统和「普通家庭作业」相比——但那个系统同时还提供即时反馈、更多练习和更多提取。这种情况下你测的不是自适应,你测的是练习量。

以及它是怎么被实施的。一个平台只有在学习者真的用得够多、而且底层模型足够好时才能适应。大量令人失望的研究,说到底就是学生每周只用了二十分钟。

没人问的那个问题:这钱花得值吗?

个性化是昂贵的。它需要数据、软件、教师培训和时间。

与此同时,有几项完全不个性化的干预,几乎不花钱就能产生有意义的效应。把复习间隔开而不是集中在一起(塞佩达等人,2006)对所有人都有效。用自测代替重读也是。交错练习不同题型同样是。

这个比较值得在投资之前先做一遍:如果你可以应用三条免费的普适原则,或者买一套昂贵的自适应系统,合理的顺序是先把免费的做掉。

如果你是自学,这意味着什么——能用的那部分

以上都是关于学校的。如果你在自学一门语言,图景会以一种有意思的方式移动:你本身就已经是一个自适应系统。

你知道自己会忘掉哪些词。你知道自己在哪里会卡住。你不需要一个算法来告诉你。唯一的问题是,你会不会照着它行动——还是继续复习那些你已经会的东西,因为复习已知的感觉更舒服。

而且有一种已被证实的个性化形式,便宜且现成:间隔重复。一套好的卡片系统会依据你的实际表现调整间隔——难的卡片更早回来,容易的卡片飘得更远。这恰好是第一种和第二种个性化的合体,而且人人都够得着。

对自学者来说,由此得出三条原则:

个性化难度,不要个性化形式。把材料调整到你能力的边缘上,有效。因为自认是「视觉型学习者」而改看视频,无效。

让数据决定,不要让感觉决定。流畅是个糟糕的指标。算数的是它能不能撑过一周——而这恰恰是间隔系统在替你测量的东西。

还有,不要把标准化的部分丢掉。一门结构完整的课程、一份分级词表、一条合理的语法序列——这些标准化的东西之所以存在,是因为它们管用。个性化应该是叠加在一个好框架之上的一层调整,而不是「有没有框架」的替代品。

诚实的答案

个性化胜过标准化教学吗?胜过,但幅度远小于宣传,而且只有在个性化了正确的东西时才成立。

把进度和难度调整到学习者的真实水平:有证据,效应中等,值得做。按偏好和「风格」调整:没有证据,而且已经被检验得足够彻底,可以有底气地这么说。

那个「两个标准差」应该退休了。但取代它的发现,对任何一个独自学习的人来说更令人振奋:好导师和好系统之间的差距很小,而「有系统」和「什么都没有」之间的差距很大。对一个孤身的学习者来说,这是好消息。

读简明版

同样的内容,用浅白的话再讲一遍——写给年纪小的读者,也写给想快点抓住要点的人。

只要读过任何一个学习平台的宣传,你几乎一定见过这个数字:一对一辅导能把学生推到普通课堂教学之上两个标准差——把一个平均水平的学生送进前 2%。

这个数字是真的。它出自 1984 年,并成了整个行业的道义基石。

麻烦在于它站不住。而取代它的那个结论,要有用得多。

「两个西格玛」后来怎么了

那个结果来自几项小型研究:受过精心训练的辅导者、很短的内容单元、理想条件,而且用的是与那部分内容直接绑定的测验来衡量。

当整片辅导文献被系统检视时,数字谦逊得多:真人辅导的效应约为 0.79——而值得注意的是,计算机辅导约为 0.76

两个结论一起到来。两个西格玛是海市蜃楼。而机器在辅导这件事上已经接近人:真人导师与好软件之间的差距,远小于「有辅导」与「什么都没有」之间的差距。

「个性化」不是一样东西

关于这件事的争论大多没有结果,因为双方用同一个词指着不同的东西。至少有三种,而它们的证据差得极远。

  • 个性化节奏。没掌握的人继续做,掌握了的人往前走。这是证据最扎实的一种——效应约 0.5——也是最不光鲜的一种。
  • 个性化难度。系统追踪你错在哪儿,再挑下一步给你。稳当,中等。
  • 按偏好或「风格」来个性化。没有证据——而且被检验得足够彻底,可以有底气这么说。

对自学的人来说

你本来就知道自己忘的是哪些词。你知道自己在哪里卡住。你不需要一个算法来告诉你。唯一的问题是,你会不会照着做;还是继续复习那些早就会的东西,因为复习已知的感觉更舒服。

而有一种被证明有效的个性化,既便宜又现成:间隔重复。一个好的系统会按你真实的表现调整间隔——难的卡片更早回来,容易的往后飘。那正是节奏与难度的合体,人人够得着。

三条原则

  • 个性化难度,不要个性化形式。把材料调到你能力的边缘上,管用。因为觉得自己是「视觉型」就改看视频,不管用。
  • 让数据决定,不要让感觉决定。「顺」是个很差的指标。要紧的是它能不能撑过一星期。
  • 别把标准化的那部分扔掉。一门有结构的课程、一份分级词表、一个合理的语法顺序——这些东西存在,是因为它们管用。个性化是加在一个好框架之上的调整层,不是「不要框架」的替代品。

老实的答案

个性化能胜过标准化教学吗?能——但远不如广告里说的那么多,而且只有在个性化了对的东西时才成立。

两个西格玛这个数字该退休了。但取代它的发现,对自学的人更提气:好导师与好系统之间的差距很小,而有系统与没系统之间的差距很大。

来源与延伸阅读

这些文章综合了学习科学与语言学中公认的研究成果。主要来源与延伸阅读:

  • Bloom, B. S. (1984). The 2 sigma problem: The search for methods of group instruction as effective as one-to-one tutoring. Educational Researcher, 13(6), 4–16.
  • VanLehn, K. (2011). The relative effectiveness of human tutoring, intelligent tutoring systems, and other tutoring systems. Educational Psychologist, 46(4), 197–221.
  • Kulik, C.-L. C., Kulik, J. A., & Bangert-Drowns, R. L. (1990). Effectiveness of mastery learning programs: A meta-analysis. Review of Educational Research, 60(2), 265–299.
  • Ma, W., Adesope, O. O., Nesbit, J. C., & Liu, Q. (2014). Intelligent tutoring systems and learning outcomes: A meta-analysis. Journal of Educational Psychology, 106(4), 901–918.
  • Kulik, J. A., & Fletcher, J. D. (2016). Effectiveness of intelligent tutoring systems: A meta-analytic review. Review of Educational Research, 86(1), 42–78.
  • Pashler, H., McDaniel, M., Rohrer, D., & Bjork, R. (2008). Learning styles: Concepts and evidence. Psychological Science in the Public Interest, 9(3), 105–119.
  • Stockard, J., Wood, T. W., Coughlin, C., & Rasplica Khoury, C. (2018). The effectiveness of Direct Instruction curricula: A meta-analysis of a half century of research. Review of Educational Research, 88(4), 479–507.
  • Walkington, C. A. (2013). Using adaptive learning technologies to personalize instruction to student interests. Journal of Educational Psychology, 105(4), 932–945.
  • Pane, J. F., Steiner, E. D., Baird, M. D., & Hamilton, L. S. (2015). Continued Progress: Promising Evidence on Personalized Learning. Santa Monica: RAND Corporation.
  • Cepeda, N. J., Pashler, H., Vul, E., Wixted, J. T., & Rohrer, D. (2006). Distributed practice in verbal recall tasks: A review and quantitative synthesis. Psychological Bulletin, 132(3), 354–380.

记住这一点——几天后再来复习。

更多学习科学相关内容