斯特鲁普色词测试(Stroop 效应)
颜色词的墨色时而与词义不符 —— 对墨色作答,而不是词义。40 轮计分测试测量你的 Stroop 效应:干扰造成的耗时(毫秒)。
这个测试测什么
认知干扰控制 —— 经典 Stroop 范式。屏幕上出现一个颜色词(红、蓝、绿、黄),其墨色可能与词义不一致;你需要用 R/B/G/Y 键或屏幕按钮对文字的墨色作答。测试先进行 5 轮不计分的练习,随后是 40 轮计分测试 —— 一半为一致试次(词义与墨色相同),一半为不一致试次 —— 每轮前都有短暂的注视十字,每轮限时 4 秒(超时按答错计)。只有 200ms 到 3000ms 之间的正确作答才计入用时,你的成绩是 Stroop 效应:不一致试次的平均反应时减去一致试次的平均反应时(毫秒),下限为 0(测出负值属于抽样噪声,而非超人的抗干扰能力)。越低越好 —— 它是自动化阅读与颜色判断冲突时大脑付出的时间代价。如果正确率低于 70%,或任一类试次的有效作答少于 5 次,本轮将被判为无效而不给出成绩,快速乱猜没有用。
科学依据
Stroop 任务是心理学中被重复验证次数最多的发现之一。John Ridley Stroop 于 1935 年发表该研究(Journal of Experimental Psychology,'Studies of interference in serial verbal reactions'),证明说出不匹配颜色词的墨色,比在无冲突条件下报告颜色明显更慢。原因在于自动化:对熟练阅读者而言,读词是不由自主的,速度快于颜色命名,因此必须主动抑制冲突的词义。MacLeod 的里程碑综述(1991,Psychological Bulletin,'Half a century of research on the Stroop effect')整合了数百项研究,最初的口头命名程序的典型干扰量约为 100ms。按键作答的版本(如本测试)产生的干扰更小(MacLeod 1991),因此本测试采用以 75ms 为中心的按键版常模 —— 较宽的 55ms 离散度同时吸收了单次 40 轮测试的测量误差 —— 该常模为初始估计,待真实数据校准。
如何提高 Stroop 成绩
说实话:Stroop 效应以难以消除著称。Stroop 在 1935 年的论文中就做过练习实验 —— 连续多天的训练能缩小干扰量,却始终无法消除它,这一结果九十年来一再得到验证(MacLeod 1991)。你能影响的部分:反复接触该任务会让效应略微下降(重测成绩的提升大多来自对按键和流程的熟悉,而非大脑变快)、充足睡眠和清醒状态有帮助、沉着作答而非抢快可以避免正确率惩罚。对商业化'大脑训练'的宣传保持怀疑 —— 一项权威专家综述发现,训练获得的提升几乎没有证据能迁移到广泛的现实认知能力(Simons et al. 2016,Psychological Science in the Public Interest)。把你的成绩当作干扰控制能力的一个快照,最好与自己在同一设备上的重测成绩比较。
常见问题
Stroop 效应多少算好?
对照本测试的按键版常模(均值 75ms、标准差 55ms —— 基于 MacLeod 1991 的按键版估计),干扰量低于 20ms 大约进入前 16%,75ms 左右为平均水平,高于 130ms 则处于后 16%。0ms(测不出干扰)是可达到的最好成绩,约为前 9%。这些是基于文献的初始估计,待我们的真实数据校准。
什么是 Stroop 效应?
由冲突信息造成的延迟:当'蓝'这个词用红色墨水呈现时,说出墨色所需的时间明显长于词义与颜色一致时。该现象由 John Ridley Stroop 于 1935 年首次系统记录,是选择性注意与抑制控制的标准测量指标。
为什么我无法忽略词义?
因为阅读是自动化的。熟练阅读者无法关闭文字识别 —— 在你判断出墨色之前,词义已经被加工完毕,冲突只能靠主动抑制来解决。这个抑制成本正是本测试测量的东西(MacLeod 1991)。
练习能减小 Stroop 效应吗?
部分可以。Stroop 1935 年的原始实验显示,连续多天练习能缩小干扰量,但无法将其消除。前几次重测你的效应通常会下降,主要来自对按键和流程的熟悉;底层的阅读自动化不会消失。
正确率重要吗,还是只看速度?
都重要。只有 200ms 到 3000ms 之间的正确作答才计入一致/不一致的平均反应时,每轮超过 4 秒未作答按答错计;如果 40 轮计分测试的正确率低于 70%,或任一类试次的有效作答少于 5 次,本轮会被判为无效 —— 没有百分位,也不会写入个人最佳。答得快但错得多,是本测试拒绝计分的策略。