论文摘要 · 2026-08-17

Lu et al.:产生心流的是「难度」还是「投入的努力」?——Fukai 解读

心流体验 / 心理努力 / 难度设计(心理学)

一段话摘要

把难度匹配玩家的技能,就会进入心流(忘记时间、全神贯注的状态)——这是游戏设计中被引用最多的定说之一。今天读的这篇论文,试图在这条定说上划开一道口子:驱动心流的到底是任务本身的难度,还是玩家在其中实际投入的努力量?迄今为止,这两者一直被当作一个整体来对待。

作者使用了视觉辨别任务(判断两张网格图像是相同还是有一格发生了偏移),用网格的精细程度来操纵「难度」,用事先告知「有差异的试次占全体的百分之多少」来操纵「投入努力的动机」,两者分开操纵。同时还测量了脑电波 P300。该研究发表于同行评审期刊 Psychological Research(Springer, 2025)。

结果并没有落进一个简单的图式里。难度操纵的效应非常强烈(效应量 ηp²=0.64),而期望操纵在个体层面没有效应,只在试次层面表现出微弱效应(困难条件下 d=0.04)。心流随难度呈现出倒 U 形,但仅是临界值(p=0.053),P300 与心流没有表现出任何关系(b=-0.003, p=0.97)。应该带走的不是一个结论,而是一张地图——「难度」这一个词,实际上至少分裂成了三个独立的旋钮。

引言

论文标题为 Disentangling the effects of task difficulty and effort on flow experience。作者是 Hairong Lu、Dimitri Van der Linden、Arnold B. Bakker 三人,所属约翰内斯堡大学产业心理学与人才管理系。发表于 Psychological Research(Springer)第 89 卷第 4 期,论文编号 113,在线发表于 2025 年 6 月 26 日,DOI 为 10.1007/s00426-025-02128-x。这不是 arXiv 预印本,而是通过了同行评审的论文。

我选择这篇论文的理由是:对于每天推出解谜内容的一方来说,把难度放在哪里是最大的设计变量,而支撑这个决定所援引的心理学定说,我并不想原样相信。如果要使用一条定说,我希望先读过检验这条定说本身的研究。这篇论文恰恰就是在心流研究核心的「挑战与技能相匹配」这一解释中,插入了另一个解释变量。

不过先在此加上一个保留:这是心理学的单次实验,参加者只有 37 人,作者自己也将其定位为探索性研究。文中也没有关于事先注册(preregistration,指在实验前公开假设与分析步骤,以防止在看到结果后再更换解释)的记载。本文会把已被证实的部分和尚未被证实的部分分开来写。

背景

心流研究的定说是这样的:当任务的挑战度与玩家的技能相匹配时就会产生沉浸感,太简单会无聊,太困难会焦虑。也就是说,心流相对于难度呈倒 U 形(中间高、两端低)。游戏设计教材大多引用的正是这种形状。

然而,还有另一支研究谱系画出的曲线几乎一模一样,那就是心理努力(mental effort,投入到任务中的脑力量)的研究。根据动机强度理论(motivational intensity theory,即只要任务被认为仍可达成,努力就会持续增加,一旦被判断为不可能达成便会骤然下降的框架),努力同样相对于难度呈倒 U 形。而且两者甚至共享瞳孔扩张这样的生理指标。

问题就出在这里。如果心流和努力在同一个难度位置上形成同样形状的山峰,那么我们一直以来解释的「因为挑战与技能相匹配所以进入了心流」,实际上可能只是「因为那里是最容易投入努力的点」。作者提出的问题是:能否用实验把这两者拆分开来?如果能在不改变难度的情况下单独调动努力,拆分就成为可能。

方法 / 途径

实验采用被试内设计(within-subjects,即同一批参加者体验所有条件),为 3(难度)×2(期望)共 6 个条件。任务是视觉辨别:同时呈现两张由白色与浅灰色方格组成的网格图像,判断二者是否相同,或是否有一格发生了偏移。难度通过网格的精细程度来操纵——2×2(简单)、8×8(中等)、14×14(困难)。网格越精细,找出偏移的那一格就越困难。

至于努力,则需要在不改变任务本身的前提下加以操纵。为此作者使用了 EPDD(expected probability of detecting differences,即事先告知的、预期能发现差异的概率)。控制条件被告知「本组试次中有差异的占全体的 50%」,高期望条件被告知「占 80%」。这一操纵基于期望价值控制的思路——成功的把握越高,就越会被判断为值得投入努力。

测量指标共四项。心流采用单题 10 分量表(「你认为自己处于心流状态的程度如何」,使用前先通过访谈让参加者理解心流的含义);主观难度采用 -3 到 +3 的 7 级量表(是否与技能相匹配);努力的代理指标是反应时间与正确率;生理指标是脑电波 P300(刺激出现约 300 毫秒后出现的脑电波峰值,据信与注意资源的分配有关),在 Pz 电极 300〜400 毫秒的时间窗内采集。

参加者为 37 名本科生(女性 29 名,平均年龄 19.87 岁,SD 1.78),这是剔除 1 名脑电数据缺失者和 1 名误解心流含义者之后的人数。共进行 6 个 5 分钟的区组,顺序随机排列。分析采用混合效应模型(一种在把参加者之间的个体差异吸收为随机因素的同时估计整体趋势的方法),事后比较施加了多重比较校正。

发现

首先,操纵按预期实现了分离。主观难度随网格精细程度大幅变动,F(180,2)=162.80, p<0.001,效应量 ηp²=0.64。简单条件比中等条件感觉更简单 d=1.24,比困难条件感觉更简单 d=2.30。另一方面,期望操纵没有影响主观难度(F(180,1)=0.85, p=0.36)。可以说难度与期望作为两个独立的旋钮各自发挥了作用。此外值得一提的是,中等难度×高期望这一条件几乎正好落在了「技能与挑战相匹配」的位置上(均值 -0.11,与零无显著差异)。

再看努力。在个体层面,反应时间随难度剧烈变动(F(180,2)=1202.45, p<0.001, ηp²=0.93),正确率也是如此(F(180,2)=533.53, p<0.001, ηp²=0.86),但期望没有出现主效应(反应时间为 F(180,1)=1.69, p=0.195)。然而当粒度提高到试次层面(8,785 个试次)时,期望的效应显现出来:F(1,8743.1)=11.93, p<0.001。但细看分项,简单条件下没有差异(p=0.436, d=0.01),只有在中等(p=0.005, d=0.05)和困难条件(p=0.003, d=0.04)下,高期望才拉长了反应时间。效应量极小。

至关重要的心流,总体均值为 6.14(SD 1.977,满分 10 分)。在控制期望条件下,可以看到心流相对于难度呈倒 U 形,但处于临界水平(二次项系数 b=-0.66, p=0.053)。在高期望条件下,这个倒 U 形消失了(b=-0.35, p=0.292)。难度的主效应也没有达到显著水平(F(2,180)=2.63, p=0.074),即使在困难条件下比较高期望与控制组,t(36)=1.69, p=0.099, d=0.28,同样不显著。作者写道「心流的变化看起来像是在追随努力的变化」,同时也明确指出交互作用并不显著。

生理指标一侧则是明显的落空。无论在控制条件还是高期望条件下,P300 都没有表现出相对于难度的倒 U 形(p=0.706 / p=0.140),与心流之间也看不出关系(b=-0.003, p=0.97)。作者一方面提到此前也有部分研究报告过类似的零结果,一方面把这一结果定位为「对心流神经相关物的既有假设提出了质疑」。

可用之处

第一,如何对待难度提示。像「今日正确率 68%」这样的显示方式,完全不改变盘面本身,只是调动「感觉能解开」这一把握。这项研究提示的是,这类期望操纵在区组层面几乎不起作用,只在试次层面表现出微弱效应。如果是这样,比起开局前来一条横幅,在解题过程中不断更新的手感——确定的格子增多、候选减少、剩余步数可见——或许更容易调动期望。

第二,提示的设计。如果是我在做一款 Sokoban-like,我会优先放置肯定思路方向的提示(「这个箱子最后再动」),而不是替玩家代劳的提示(「把这个箱子放到这里」)。前者会直接减少努力本身,后者则在保持努力量不变的前提下,只提高成功的把握。用本研究的框架来说,只有后者对应的是提高 EPDD 的干预。考虑到效应量偏小这一点,这个方向仍然值得一试。

第三,playtest 的测量粒度。这篇论文最具实务价值的教训,或许就是同一个操纵在个体层面看不见,在试次层面却能看见这一点。如果是我要评估一次每日谜题的改动,比起用一道「今天玩得开心吗」的问题来汇总,我会把每一步所需时间、回退次数、中断的位置等细粒度行为日志作为主要指标,把主观量表放到辅助的位置。

第四,难度曲线的落点。在这项实验中,最接近「技能与挑战相匹配」这一点的,是中等难度叠加高期望的条件(主观难度均值 -0.11)。如果要在超休闲游戏的 PCG(Procedural Content Generation,内容自动生成)中自动调节难度,那么先瞄准正确率中段附近,再在此基础上叠加「感觉能解开」的信号,这种两段式做法——至少在这个条件下——是一种比较不勉强的安排。

局限

作者自己承认的弱点不少。期望操纵是以区组为单位进行的,可能稀释了逐试次的影响,导致效应量偏小。控制条件的 50% 这一数值本身已经偏高,可能因天花板效应而掩盖了与更低期望条件之间的差异。37 人这一样本规模,文中明确写明是出于实务考虑而非检验力分析所定。瞳孔直径因任务性质(处理时间长、眼球运动频繁)而无法使用,导致生理指标仅限于 P300。而且总体上,作者自己写道这些结果仍停留在「初步但具有新意的提示」这一层面。

我在这里首先要指出的是 p 值的排列。主要结果集中在 0.053、0.074、0.099 这样的临界值上。如果只有一个,还可以说是偶然,但排成这样一列,准确的解读应该是「或许存在效应,但这个样本还没能把它确认下来」。至少这不能作为断言「心流由努力而非难度决定」的材料。即便是在试次层面达到显著的期望效应,效应量也只有 d=0.04〜0.05,很难说是实务中能被察觉到的大小。

还有一点是任务的性质。这项实验的任务是抽象的视觉辨别,没有故事、没有目标、也没有他人的目光。解谜游戏中产生的心流,很大程度上是由「解开这件事本身的意义」所支撑的,我想谨慎对待把在剥离了这些要素的任务上测得的心流,原样搬回每日谜题设计中这件事。此外,参加者是同一所大学的 37 名本科生,平均年龄 19.87 岁,与一般的解题者群体并不重合。

总的来说,可以这样整理:这篇论文的价值在于展示了「可以设计出把心流与努力拆分开来的实验」,但还没能断言「拆分之后的结果就是如此」。既然没有事先注册的记载、作者本人也将其定位为探索性研究,那么在有后续重复验证出现之前,把它当作一个假设来对待才是恰当的。考虑到心理学领域的可重复性问题,这种态度也谈不上过分谨慎。

Fukai 的解读

接下来是我自己的解读。我想把这项研究放进一条正在把「难度」这一个词所压缩的设计变量重新拆解开来的潮流之中。任务一侧的难度、玩家实际投入的努力、以及感觉能解开的把握——在设计现场,这三者一直被当作一个旋钮来对待。我认为这篇论文给出的不是一个结论,而是一张显示旋钮至少有三个的地图。用设计批评的词汇来说,难度调节与其说是让任务变简单,不如说更接近于设计出让玩家觉得「值得投入努力」的条件。不过,这一解读本身并非这篇论文所实证的内容。

结语

想更深入了解的人,我推荐搭配阅读 Strojny 等人 2023 年发表在 PLOS ONE 上的研究。该研究在实际游戏(Icy Tower)中检验了动机强度理论,让 39 名参加者游玩了四个难度等级。其结论是「只要任务仍处于可达成的范围内,投入度就会随难度上升,一旦变得无法达成便会骤然下降」。这项研究从真实游戏的一侧,观察了今天这篇论文在实验室抽象任务中处理的同一个框架。把两篇放在一起看,就能画出一张地图,标明难度、努力与投入之间的关系目前弄清楚了多少、又从哪里开始还未弄清楚。

心流研究本身已经积累了数十年,今天这篇论文不过是在其中一角加入了一次检验而已。正因如此,读了这一篇就认为「弄清了心流的真面目」是错误的,我认为准确的理解应该是「被『心流』这个词一直捆绑在一起的东西,正开始被实验的手法逐渐拆解」。做谜题的人所能做的,是把这场拆解的中间进展,拿到自己的盘面上验证一下。

参考文献

本文参考的论文与相关资料:

・Disentangling the effects of task difficulty and effort on flow experience (Hairong Lu, Dimitri Van der Linden, Arnold B. Bakker, 2025, Psychological Research 89(4), Article 113 / peer-reviewed)

・DOI: 10.1007/s00426-025-02128-x

・该论文的开放获取版本 (PubMed Central, PMC12202627)

・相关研究: Player involvement as a result of difficulty: An introductory study to test the suitability of the motivational intensity approach to video game research (Paweł Strojny, Agnieszka Strojny, Krzysztof Rębilas, 2023, PLOS ONE)

Reactions (no login)

Anonymous • one of each per visitor per day

学习 — 课程

学习第4部 Difficulty — Designing the Learning Curve and Failure第12章 Measuring Difficulty第6 / 10篇

関連シリーズ

Paper Digest第60回 / 全99回

Read next