论文导读 · 2026-08-01

Jeong 等:同一问题,换一种答题方式,难度也会不同——Fukai 解读

认知负荷 / 交互设计 / 儿童注意力评估

一段摘要

同一项任务,仅改变用来作答的部件,成绩就会发生变化。本论文在平板电脑上的斯特鲁普任务(经典的注意力测试:呈现用另一种颜色书写的颜色名称文字,要求忽略文字含义、回答墨迹的颜色)中验证了这一点。答题方式有两种:从写有“红、蓝、黄”的文字按钮中选择(text 形式),以及从彩色方块图案中选择(color 形式)。刺激本身、字体大小、按钮尺寸、布局、触控机制全部相同,不同之处仅在于选项的外观。

127名6至12岁的儿童完成了两种形式后,color 形式的正确率更高(0.91对0.86,效应量 Cohen d=0.34,P<.001),反应时间更短(1183.21毫秒对1268.56毫秒,差值−85.4毫秒,d=−0.69,P<.001)。此外,只有 color 形式的成绩与家长评定的注意力问题存在显著相关(r=−0.20,P=.03;text 形式为 r=−0.05,P=.56)。而根据前额叶血流测得的脑部指标则未出现显著差异。

作者的结论是:“答题形式同时影响任务负荷与测量的效度。”换成对解谜设计者而言的说法可以理解为:难度中一部分来自内容本身,另一部分来自输入方式的构造,而后者可以由设计一方来削减。

引言

本次介绍的是 Harim Jeong、Yong Jeon Cheong、Jihyeong Ro、Jihyun Cha、Jongkwan Choi、Minyoung Jung 撰写的论文,刊载于 JMIR Serious Games(2026年,第14卷,e93468)。这是一篇通过同行评审的正式原创论文(DOI: 10.2196/93468,刊载日期2026-05-26)。同一份稿件的预印本已于2026-02-22发布在 JMIR 的预印本服务器上,想比较评审前后差异的读者可以查阅那份稿件。第一作者及通讯作者所属机构为韩国脑研究院(Korea Brain Research Institute,大邱),其中两名作者所属 OBELAB 公司,该公司制造本研究使用的测量设备。

我今天选择这篇论文的理由很简单。在调整解谜难度时,必然会碰到一个问题:这份难度,是来自问题本身,还是来自操作本身?这篇论文恰恰用实验的方式把这两者区分开来,而且区分的方式并不粗糙——保持刺激不变,只替换选项的外观,这种设计对实现者来说很容易借鉴。

由于这篇论文写在医疗、临床的语境下,并未直接谈及游戏。但“同一项任务,输入形式一变,能测到的东西也会变”这一骨架,可以直接搬回到日更解谜的计时,或是自适应难度设计中。我不是把它当作一篇临床论文来读,而是把它当作一篇实测了 UI 对成绩的污染程度的论文来读。

背景

作为理论基础的是认知负荷理论(cognitive load theory,处理人在处理信息、执行任务时所需心理努力的框架)。该理论把负荷大致分为两类:任务本身内在要求的部分(intrinsic load,内在负荷),以及源自呈现方式或操作构造的多余部分(extraneous load,外在负荷)。在教育及电子学习领域,已反复证实通过改善呈现方式来减少外在负荷可以提升成绩。

然而在数字健康领域,作者整理指出,这一视角的研究主要针对医护人员一侧的工作流程,对于患者或儿童直接接触的评估工具则研究不足。这之所以成为问题,是因为评估工具中负荷的增加会造成错误答案或反应迟缓,而这些会作为“画面构造的影响”而非“该儿童真实的注意力”混入数据之中。作者将其称为掩盖了目标构念的噪音。

被选作题材的斯特鲁普任务,是测量选择性注意与抑制能力(压制无关信息、使用必要信息的能力)的经典范式。文字含义与颜色不一致的试次比一致的试次更慢,错误也更多。作者指出,这种差异反映了解决干扰所需的努力,因而对设计所致的负荷变化十分敏感。此外,小学阶段的儿童阅读尚未完全自动化,让他们通过阅读文字来作答,可能会把阅读流畅度与抑制能力混在一起——这正是本研究假设的出发点。

研究方法

参与者是从韩国当地社区招募的发育正常儿童。2023年1月至9月间共有137人报名,其中7人因设备或通信故障、3人因中途退出而被排除,最终127人(女童55人,占43.3%;男童72人,占56.7%;平均年龄9.15岁,标准差1.56,年龄范围6至12岁)成为分析对象。全体参与者均完成两种形式,采用被试内设计(对同一人施加两种条件并进行比较的方法),事前的敏感性分析显示该样本量具有检测出 d=0.25 以上效应的统计功效。

任务在平板电脑(Samsung Galaxy Tab Advanced2)上实现。两种条件下,例如都会呈现用黄色墨迹写成的“蓝”字这样的刺激,要求忽略文字含义、回答墨迹颜色。text 条件下从文字标签中选择答案,color 条件下从色块中选择答案。由于两种条件都保留了文字与颜色之间核心的冲突,内在负荷因此被固定,唯一被改变的只是作答阶段的外在负荷。流程为5次练习试次后进行45次正式试次,条件之间设有30秒休息,整体按自身节奏进行。

负荷的测量使用了 fNIRS(functional near-infrared spectroscopy,一种利用近红外光捕捉大脑表层血流变化的非侵入式测量方法),以15个通道记录前额叶。指标共有两个:由通道间相关性构建的功能连接,取任务中数值减去5分钟静息状态数值所得的变化量(ΔFC),以及表示整个网络信息交换效率的全局效率。行为层面则使用正确率、反应时间,以及整合两者的综合成绩指标(吸收速度与准确率之间权衡的指标,等同于 Rate Correct Score)。

作为效度的衡量标准,研究使用了由家长填答的行为评定量表 BASC-2 中的“注意问题”分量表,按条件比较其与任务成绩的相关性。此外还用智力测验(K-WISC-V)控制了整体认知能力,将年龄与总智商通过回归从成绩中剔除后得到残差,对残差应用随机森林(组合大量决策树、同时可查看哪些变量对预测有效的方法),比较脑指标与行为指标各自的贡献大小。

研究发现

行为层面的差异十分明确。正确率方面,color 条件0.91(SD 0.09)对 text 条件0.86(SD 0.16),平均差0.05(95%置信区间0.03~0.08),t126=3.81,Cohen d=0.34,P<.001。反应时间方面,color条件1183.21毫秒(SD 146.78)对 text 条件1268.56毫秒(SD 145.18),差值为−85.4毫秒(95%置信区间−107.2~−63.5),t126=−7.72,d=−0.69,P<.001。综合成绩同样如此,color 0.036(SD 0.007)对 text 0.031(SD 0.008),t126=6.81,d=0.62,P<.001(论文表1)。效应量处于中等至较大范围。

另一方面,脑部指标未出现差异。ΔFC 方面,color 条件0.12(SD 0.33)对 text 条件0.07(SD 0.29),t126=1.65,d=0.15,P=.10;前额叶全局效率方面,color 条件0.55(SD 0.17)对 text 条件0.53(SD 0.17),t126=1.52,d=0.14,P=.13。两项指标在数值上都朝 color 条件较高的方向靠拢,但均未达到统计显著。作者列出的理由包括:在发育期的 fNIRS 研究中,这种程度的效应量属于常见范围;在前额叶仍持续发育成熟的年龄段,连接模式尚不稳定;以及两种条件共享核心冲突,因而差异本身十分细微。

在效度比较中,color 条件的成绩与家长评定的注意问题存在显著相关(r=−0.20,95%置信区间−0.37~−0.03,P=.03),而 text 条件几乎不存在相关(r=−0.05,95%置信区间−0.23~0.12,P=.56)。但是,对两个相关系数之间差异本身进行的 Fisher r-to-z 检验结果为 z=1.54,P=.12,作者自己也写道“接近但未达到常规显著性水平”。这一点未被断言,值得留意。

随机森林的结果又更进一步有趣。在直接纳入年龄与智商的模型中,大部分贡献被年龄吸走(color 条件58.86%,text 条件73.21%)。但在把年龄与总智商从成绩中剔除后的残差模型中,脑指标转而成为主角:全局效率 color 39.79% / text 43.60%,ΔFC color 35.75% / text 33.02%,注意问题在两种条件下均约占24%。摘要中提到,前额叶效率的个体差异解释了残差方差的40%至44%。此外还报告了年龄的相对贡献在 color 形式下更小(58.86%对73.21%)。

应用场景

第一点。在做难度的 A/B 测试时,可以准备两个版本——盘面逻辑完全不变,仅替换输入方式的构造——然后比较正确率与耗时。这篇论文正是采用了这一手法,仅改变答题形式便使正确率移动了5个百分点、反应时间移动了85毫秒。如果自己在制作数独类或 Slitherlink 类的日更解谜游戏,却被反馈“体感偏重”,首先该怀疑的不是盘面逻辑,而是数字输入或画线方式的构造。这篇论文的控制方法——固定字体、按钮尺寸、布局、触控机制,只改变选项的形式——可以直接借用。

第二点。如果拥有比拼计时的机制,就应该以“输入方式的构造会直接影响排名”为前提来设计。85毫秒作为绝对值很小,但效应量 d=−0.69 绝不算小。如果日更解谜的排行榜或周榜设计成几百毫秒就有意义,那么这个差距的一部分,可能测量的并非“技巧”,而是“易于点按的程度”。我在这里具体建议的,是一条简单的运营规则:记录模式与练习模式不要使用不同的输入界面。

第三点。如果把成绩用于估算玩家实力或驱动自适应难度,应选择外在负荷较低的形式作为测量手段。在这项研究中,与外部标准(家长评定)相关的只有 color 形式。转换到游戏语境:如果想估算玩家的真实水平,却输入了混杂操作摩擦的数字,自适应的方向就会出错。在依据成绩决定提示出现时机的机制中,这种污染会直接变成对用户体验的误判。

第四点。在面向儿童或非母语使用者的解谜游戏中,能不让人阅读的地方就不要让人阅读。这篇论文的设计思路是:用色块取代文字标签,将作答阶段的语言处理彻底去除。图标化、色彩区分、图形化都可以作为负荷削减的手段发挥作用,而非仅仅是装饰。第五点,还有一个针对玩家模型的教训:构建模型时应首先控制年龄与经验量。在这项研究的原始模型中,年龄占据了六到七成的贡献。同样的结构也可能出现在自己手头的日志数据中。

局限性

作者自己列出了四点弱点。条件的呈现顺序固定为 color→text,因此无法排除练习效应或疲劳的影响(不过作者论证说,练习效应理应对后面进行的 text 更有利,而即便如此 color 依然胜出,因此该效应对顺序混杂应具有一定的稳健性)。对象仅限于发育正常的6至12岁儿童,无法保证能推广到其他发育阶段或临床群体。脑部指标较为粗糙,只观察了全局效率与条件层级的 ΔFC,若采用事件锁时分析或逐通道分析,或许能获得更高的敏感度。此外,随机森林的预测性能较为有限(交叉验证 R² 为9%至23%),因此应将其视为对相对重要性的探索性估计,而非已确立的预测模型。

以下是我阅读后注意到的一点。首先,身为 Fukai,我要在此指出的是,阅读流畅度本身并未被测量。这项研究的核心论证是“小学阶段的阅读尚未自动化,因此让儿童阅读文字来作答会混入阅读能力”,然而并未采集阅读能力的指标,而是用年龄与智力测验作为代理变量。论证中最关键的那一部分并未被直接验证。

第二点。效度方面的论证终究是较弱的。color 形式显著、text 形式不显著这一对比很吸引眼球,但直接检验两个相关系数之间的差异并不显著(z=1.54,P=.12)。一方显著、另一方不显著,并不意味着两者之间存在显著差异。作者本身也诚实地这样写了,但摘要中的结论句读起来稍显更强。我认为不能写成“研究表明 color 形式的效度更高”。相关系数本身也只有 r=−0.20,置信区间的上限已经逼近−0.03。

第三点。所使用的 fNIRS 设备 NIRSIT Lite 的制造商 OBELAB 公司有两名研究人员作为共同作者参与,并负责提供设备与分析软件。这一点在论文的作者贡献栏中已有明确说明,并未被隐瞒,但在解读脑指标相关内容时值得留意。第四点,与其说是局限性,不如说是需要留意之处:两种条件究竟是“同一任务的不同难度”,还是“不同的任务”,这一疑问依然存在。去除作答阶段的语言竞争,可能不仅降低了负荷,还改变了所测量的内容本身。作者对此已准备了反驳意见,但并未彻底解决这一疑问。

Fukai 的解读

这一部分纯粹是我个人的解读。我想把这项研究放在“把认知负荷理论从教室搬到屏幕上”这一潮流中最贴近实务的一端。用设计批评的语汇来说,这篇论文测量的是“输入税”的大小。玩家所付出的努力中,花在谜题内容上的部分与花在输入构造上的部分是两笔不同的账,后者是设计师所定下的税率。这篇论文有趣之处在于,仅仅把税率下调一档这一最小限度的操作,就撬动了成绩,甚至连与外部标准的契合度也随之改变。对解谜设计师而言,我认为不把这两笔账混为一谈,正是这门技艺的核心所在。想增加难度时却让输入变得繁琐,近乎于把税率提高却硬说是提升了挑战性。

结语

单看这一篇论文,其对象仅为127名韩国发育正常儿童,任务只有斯特鲁普一种,顺序也是固定的,属于有限条件下的观察。正确的读法不是“人就是这样”,而是“在这种条件下观察到了这样的结果”。作者自己也列出了复制研究与预先注册分析作为今后的课题(顺序的平衡设计、重测信度、扩大年龄范围、加入临床群体、时间分辨率更高的连接分析,以及通过中介分析或结构方程模型进行验证),从这个意义上说,这是一篇起点性质的论文。发表时间也尚新,还未进入被广泛讨论的阶段。

想进一步了解的读者,可以并读 Seyderhelm 与 Blackmore 的研究(2023年,Simulation & Gaming),那项研究试图同时从成绩与认知负荷的实时指标两方面测量游戏任务的难度,能看清整体版图。那篇论文以游戏本身为题材,处理的是“如何测量难度”的问题,恰好与本文“测量方式会污染成绩”这一切入点构成一对。至于认知负荷理论本身,只需掌握内在负荷与外在负荷的区别,便足以读懂这篇论文。

参考文献

本文参考的论文及相关资料:

Cognitive Load Across Interaction Formats in Digital Attention Assessment for Children: Within-Subject Neuroimaging and Behavioral Comparison Study (Harim Jeong, Yong Jeon Cheong, Jihyeong Ro, Jihyun Cha, Jongkwan Choi, Minyoung Jung, 2026, JMIR Serious Games 2026;14:e93468 — peer-reviewed)

DOI: 10.2196/93468

同一论文的预印本版本(2026-02-22首次发布,尚未经过同行评审)

・相关研究:How Hard Is It Really? Assessing Game-Task Difficulty Through Real-Time Measures of Performance and Cognitive Load (Andrew J. A. Seyderhelm, Karen L. Blackmore, 2023, Simulation & Gaming)

Reactions (no login)

Anonymous • one of each per visitor per day