- Authors

- Name
- Youngju Kim
- @fjvbn20031
引子
关于练习的建议大多是关于量的:多久、多频繁、几个小时。
可是在学习研究中被检验得比较好的不是量,而是编排。同样的总量怎么切分、按什么顺序混合、用什么形态重复。而且这个领域里有一个在实用上非常别扭的发现。
让练习过程中做得最顺的条件,和让后来留下最多的条件,是互相不同的。
这个错位是本文的中心。要点在于:自己安排的练习之所以大体上失败,原因不是懒惰而是这个错位。本文不限定于特定领域,处理的是学习的一般情形。
1. 哪些被整理为有效
最宽的一份梳理,是Dunlosky和同事们2013年发表在Psychological Science in the Public Interest上的综述。他们逐一审查了学生实际使用的十种学习技法,并给出了有用性等级(Dunlosky 等, 2013,2026-08-16 阅读)。
拿到高有用性的只有两项:练习测验,以及分散练习。中等等级的是精细提问、自我解释、交错练习。低等级的是概括、划线、关键词记忆术、心像化、重读。
值得注意的是低等级那份名单。划线和重读是学生用得最多的方法,而作者们把这两项放进审查对象的理由正是如此。使用最广的方法拿到了最低的等级——这个事实本身就预告了本文的主题。
2. 拉开间隔
这是把同样的时间连着用和分开用的差别。
Cepeda和同事们2006年发表在Psychological Bulletin上的元分析,处理了184篇论文、317个实验、839项测量(Cepeda 等, 2006,2026-08-16 阅读)。
这项研究的核心结论不是简单地说间隔好,而是最优间隔会随目标而变。按作者们的分析,学习之间的间隔与到最终测验为止的期间共同起作用,保持期越长,产生最大保持的间隔也越长。
换成实用的说法是这样:明天考试就用短间隔,半年后还想用得上就用长得多的间隔。不存在唯一正确的间隔。
有一点范围要先点出来。这项元分析的对象是言语回忆任务。要说同一条曲线可以原样套到运动技能或复杂问题解决上,这项研究里没有依据。
3. 提取练习
不是重读,而是从记忆里取出来。合上书说一遍刚读过的内容,看答案之前先自己解一遍。
Serra和同事们2025年发表在Behavioral Sciences上的综述,把这个领域主要的元分析数值汇集在了一处(Serra 等, 2025,2026-08-16 阅读)。
梳理出来是这样。Roediger和Karpicke 2006年的整理中,效应量分布在0.31到1.26之间。Rowland 2014年的元分析报告了中等大小的效应:g = 0.50。Pan和Rickard 2018年的分析报告说,即便在测验形式改变的迁移情境下也有 d = 0.40。Yang和同事们2021年的分析在真实课堂情境中报告了 g = 0.50。
也就是说,这不是只在实验室里才出现的效应,测验形态变了也还能留下一部分。而且带反馈的提取大体上优于不带反馈的提取,但即便是不带反馈的提取,也有优于追加学习的情况——这是这篇综述的整理。
也存在边界条件。Polack和Miller 2022年整理的综述列举了提取练习不太管用的那些情形(Polack & Miller, 2022,2026-08-16 阅读):错误率高却没有反馈的情况,像5分钟后这样极短延迟之后的测验,一开始就没有足够的初期学习以至于形成不了可供提取的记忆的情况,以及间隔拉得过开导致提取本身失败的情况。
最后一项在实用上很重要。提取练习不是从什么都不知道的状态开始用的方法。要有最低限度的底子才运转得起来。
4. 混合练习与情境干扰
这是把一样东西集中重复和把几样东西混起来的差别。在运动学习那一侧,它以情境干扰的名义被研究了很久。
Czyż和同事们2024年发表在Scientific Reports上的系统综述与元分析量化了这个效应。54篇研究被纳入元分析,在延迟保持测验中共分析了2,068名参与者(Czyż 等, 2024,2026-08-16 阅读)。
整体保持效应在三水平模型中为标准化均值差0.63,95%置信区间0.33到0.93。在随机效应模型中为0.71,置信区间0.41到1.01。属于中等大小。
可是把这个平均值拆开,图景就完全变了。
- 实验室条件:0.92,置信区间0.48到1.36。大效应。
- 现场条件:0.23,置信区间负0.16到0.62。不显著。
- 18岁以下:0.02。实际上等于没有。
- 成人:0.63。
- 60岁以上:1.45。
作者们明确指出,在实验室里很大的效应到了现场几乎没有。异质性也很大。整体异质性指标为90%。而且在方法学质量上,59篇里只有3篇拿到高等级。
认知领域也有类似的张力。Do和Thomas 2023年发表在Journal of Intelligence上的研究,在重新确认交错练习对类别学习的好处的同时,报告说参与者们并没有意识到那份好处(Do & Thomas, 2023,2026-08-16 阅读)。
也有方向相反的资料。Rowlandson和Simpson 2023年公开的预印本报告说,在以数学概念学习为对象的两项大规模课堂实验中没有检测到交错效应(在同一检索结果中确认,2026-08-16 阅读)。这还不是经过同行评议的论文,而且是单一报告,所以只应按那样的分量来读。不过存在方向不同的资料这件事,值得记录下来。
整理一下:交错练习的证据等级比提取练习低一格。这与Dunlosky的综述给交错练习中等等级是一致的。
5. 为什么自己安排的练习经常失败
这里是本文的中心。
有一个叫合意的困难的概念,指的是那些妨碍初期学习、却促进长期保持与迁移的条件。拉开间隔、提取练习、混合,全都属于这一类。
Binks 2026年写在Journal of Evaluation in Clinical Practice上的综述,在梳理这个概念的同时加了一条重要的警告:在多个领域里依据充分的是形成性评价、交错练习、分散练习和生产性失败这几种取径,但是不能把感觉更难这件事,不加批判地直接等同于更大的教育收益(Binks, 2026,2026-08-16 阅读)。
这条警告两边都切。既切掉了轻松的练习有效这种错觉,也切掉了反方向上"只要难就一定有效"的错觉。
而且还有关于人为什么自己纠正不了这一点的解释。de Bruin 2023年写在Medical Science Educator上的文章梳理道,感知到的努力与感知到的学习之间的关系,决定了学习者的选择(de Bruin, 2023,2026-08-16 阅读)。
简单说是这样。人把此时此刻的表现当作学习的指标。重读一遍文字就读得很顺,读得顺就觉得自己掌握得好。把一样东西集中起来练,练的轮次越多就做得越好,做得好就觉得自己在长进。
这两种情况下感觉都是准确的。那一刻的表现确实好。错的是把那份表现当作未来指标的那一部分。Do和Thomas的结果直接展示了这一点:参与者们实际上获益了,却没能意识到那份获益。
用一个构造出来的例子来画这个错位。假设两个人用同样的时间学同样的材料。一个人把材料精读三遍,在重要的地方划线。最后一遍时几乎每一句都很熟悉,学完的时候"理解得很好"的感觉很强。另一个人读一遍之后合上材料,把记得的写出来,只对漏掉的部分再确认一次,如此重复三遍。因为每次都会暴露出空白,结束时的感觉比第一个人差。
这里重要的是,两个人的感觉都是准确的。学完的那个时点上的可提取性,确实是第一个人更高。错开是在两周之后。上面看到的提取练习的效应量,量的正是那个两周之后的差距。而两个人在结束学习的时点上,谁都看不到两周之后。这是为了说明而构造的例子,并不描写某项具体实验。
所以这个问题不是意志的问题,是信息的问题。人能够接触到的唯一实时信号,偏偏是会引起误解的那一个。解决办法也不是意志,而是改变测量的时点。
6. 效应量该怎么读
把本文出现的这些数字该怎么处理,简短写一下。
第一,平均值会藏起条件。情境干扰的整体效应0.63,是实验室的0.92和现场的0.23合起来的值。首先要问的是自己的处境更接近哪一边。
第二,要看置信区间是否包含0。现场条件的区间是负0.16到0.62。意思是没有排除掉没有效应的可能性。
第三,异质性大,平均值的意义就变小。90%的异质性提示各项研究可能在测互不相同的东西。
第四,要看质量等级。59篇里只有3篇是高质量,意味着这整片文献都要小心地读。
把这四条应用上去,剩下的结论是这样:提取练习和拉开间隔可以比较放心地用。混合的方向看起来是对的,但对它的大小最好不要乐观。
7. 真要安排的话
只写从上面内容里直接跟出来的东西。
- 同样的总时间,分开好过连着。目标期越长,间隔也拉得越长。
- 把重读换成提取。合上材料先取出来,然后再确认。
- 给提取配上确认。尤其在还不太懂的阶段,没有反馈的提取是危险的。
- 不要在没有底子的状态下从提取开始。最低限度的初期学习在先。
- 混合可以引入,但把期待放低。尤其在现场条件下更是如此。
- 不要把练习中的感觉当成绩效指标。判断要靠几天后毫无准备地试一次。
最后一项最难执行,也最重要。只改这一项,其余的会跟着来。因为一旦养成几天后确认的习惯,错误的方法就会自己暴露出来。
8. 各项主张的证据等级
| 主张 | 证据等级 | 依据 |
|---|---|---|
| 练习测验和分散练习有用性高 | 多次验证 | Dunlosky 等 2013 |
| 重读和划线有用性低 | 多次验证 | Dunlosky 等 2013 |
| 最优间隔随保持期而变长 | 多次验证,限于言语任务 | Cepeda 等 2006 |
| 提取练习的效应是中等大小 | 多次验证 | Serra 等 2025 所整理的各项元分析 |
| 没有基础学习和反馈,提取就会变弱 | 多次验证 | Polack & Miller 2022 |
| 情境干扰有助于保持 | 有条件验证 | Czyż 等 2024, 仅在实验室里明显 |
| 交错练习在课堂上也管用 | 争论中 | Do & Thomas 2023 对 Rowlandson & Simpson 2023 |
| 学习者判断不好哪种方法对自己有效 | 多次验证 | Do & Thomas 2023, de Bruin 2023 |
| 感觉难,效果就大 | 无证据 | Binks 2026 明确警告 |
哪些还没有得到验证
最大的空白是跨领域的一般化。本文的依据大部分来自言语回忆、类别学习和简单运动任务。没有证据表明它以同样的量级适用于复杂的实务技能或创作。
第二是文献质量。情境干扰的元分析里59篇只有3篇拿到强质量等级,这本身就是严重的限制。作者们说明,他们没有实施漏斗图或Egger检验之类的正式出版偏倚评估。
第三,交错练习的现场效应是进行时的争论。我不打算说哪一边对。只指出一点:强烈推荐交错练习的大众资料,大体上不会提到这场争论。
第四,本文没有处理动机。再有效的练习结构,不继续下去也一文不值。而让人继续下去的因素,与这里处理的变量属于不同种类。
结语
关于练习的结构,能确定说出口的是三句话。
分开来做更好。不重读而是取出来更好。以及,练习中的感觉不能当作学习的指标。
第三句撑着前两句。因为只要还相信感觉,人就会不断退回轻松的那一边。
同样的结论从经验那一侧也会出来。从乒乓球里学到的14件事里有一条说,只图打得开心不会进步。用研究的语言是合意的困难,用经验的语言是输球的位置。只是经验那一侧的句子容易滑向"难就是好",而如上所见,那是没有依据的延伸。
还有一篇文章把刻意练习之争放在语言学习这个更窄的框架里处理。研究显示了什么:口译训练与认知能力,以及刻意练习之争在口译训练这个特殊案例里看同一场争论。那一篇处理领域特有的问题,本文只处理了不挑领域的结构。
延伸阅读:
- 上一篇:专家不是知道得更多,而是看到的东西不一样 — 作为知觉的专业性。
- 下一篇:聪明的定义 — 智力测量说了什么,又没说什么。
- 刻意练习路径工具 — 把间隔和重复周期变得看得见的工具。
- 记忆实验室 — 可以直接做提取练习的工具。
参考资料
以下是写这篇文章时在2026-08-16直接确认过的资料。链接是实际读过的地址,其中一部分是Europe PMC的公开API响应。
- Dunlosky, J., Rawson, K. A., Marsh, E. J., Nathan, M. J., & Willingham, D. T. (2013). Improving Students Learning With Effective Learning Techniques. Psychological Science in the Public Interest
- Cepeda, N. J., Pashler, H., Vul, E., Wixted, J. T., & Rohrer, D. (2006). Distributed practice in verbal recall tasks: A review and quantitative synthesis. Psychological Bulletin
- Serra, M. J., Kaminske, A. N., Nebel, C., & Coppola, K. M. (2025). The Use of Retrieval Practice in the Health Professions: A State-of-the-Art Review. Behavioral Sciences, 15(7), 974
- Polack, C. W., & Miller, R. R. (2022). Testing Improves Performance as Well as Assesses Learning. Journal of Experimental Psychology: Animal Learning and Cognition
- Czyż, S. H., Wójcik, A. M., Solarská, P., & Kiper, P. (2024). High contextual interference improves retention in motor learning: systematic review and meta-analysis. Scientific Reports
- Do, L. A., & Thomas, A. K. (2023). The Underappreciated Benefits of Interleaving for Category Learning. Journal of Intelligence / Rowlandson, P., & Simpson, A. (2023). Interleaving in mathematical category learning. PsyArXiv 预印本
- Binks, S. (2026). Why Desirable Difficulties Work: Review and Caveats. Journal of Evaluation in Clinical Practice / de Bruin, A. B. H. (2023). Supporting Students to Engage with Desirable Difficulties. Medical Science Educator