English

变换器注意力的执行控制缺陷:Stroop任务揭示LLM不能做什么

2026-06-14 · 由 PodLens 生成的忠实解读

原文:https://doi.org/10.1101/2025.01.22.634394

执行控制缺陷Stroop效应晶体智力vs流体智力注意力网络理论语境长度的隐藏天花板

这篇讲了什么

这是 Suketu Patel、Hongbin Wang 与 Jin Fan(昆士兰学院/CUNY + 德克萨斯A&M大学医学院)的一篇 bioRxiv 预印本。论文用心理学里最经典的冲突测试——Stroop任务——去拆解一个看似简单的问题:大型语言模型的自注意力机制,在功能上等价于人类注意力的哪个层面?是全部,还是只是其中一部分?答案是:LLM 表现出和人类几乎一样的 Stroop 效应(说明它训练出了类似「自动化」的东西),但随着干扰词列表变长,它的表现会以人类身上完全不会出现的方式急剧崩溃——这揭示了变换器架构里缺失的,正是人类靠前扣带回和背外侧前额叶实现的「执行控制」。

论文骨架

核心问题

大型语言模型(LLM)的自注意力机制(self-attention)在功能上等价于人类注意力的哪个层面?它是全部,还是只是一部分?

研究设计

本文用经典的Stroop任务(色词干扰测试)来测试两个当前最强多模态LLM(GPT-4o 和 Claude 3.5 Sonnet)的注意力执行控制能力。

Stroop任务的逻辑:给被试看一个颜色词,比如"RED",但是这个词用蓝色的墨水写的。你的任务是说出墨水颜色(蓝色),而不是词的意思(红色)。正常人在这种「不一致条件」下会更慢、更容易出错——这个难度差就叫Stroop效应(或冲突效应)。这个效应在心理学中是「执行控制」能力的经典测量。

实验设计: - 五种条件:一致(红字写RED)、不一致(蓝字写RED)、中性(蓝字写PEN)、混合(一致+不一致随机混合)、非词中性(蓝字写XXX) - 颜色:红/黄/绿/蓝(精确十六进制颜色值) - 列表长度:1、5、10、20、40个词 - 两个任务:颜色命名(说墨水颜色)、词语朗读(说词的文字内容) - 每个条件每个长度30次试验,共约750个试验,每模型

核心发现

好消息(LLM和人类相似的地方): - 在短序列(1-5个词)中,两个LLM都表现出明显的Stroop效应:一致条件 > 不一致条件,和人类模式一致 - 词语朗读任务(「自动化」任务):在所有长度上精度接近完美(99-100%),直到40词才略有下降 - Claude 3.5在无prompt的探索性试验中自主识别出了Stroop范式(即它「知道」这是什么测试)

坏消息(LLM和人类根本不同的地方)

混合条件(最能揭示底层机制的实验): - GPT-4o在混合条件下,整体表现在20词时跌至52%(接近随机),40词时跌至15% - 关键发现:在不一致试验中精度接近0%,但在一致试验中精度保持高达80%+ - 这说明错误几乎完全来自不一致条件——模型在有冲突时系统性失败

中性词条件(用PEN、BOOK等非颜色词): - 比不一致条件还差(40词时:GPT-4o 32%,Claude 27%) - 这揭示了原因:变换器的软注意力机制在其高维向量空间中编码了词语的语义关联,「书」的向量意外地和颜色词的向量有关联,产生了「幻觉性」颜色归因

非词条件(用XXXXX): - 显著好于其他条件!Claude 3.5在所有长度上几乎完美(100%) - 这证实了:问题不是感知能力,是语义干扰

理论解释

人类注意力有三个网络(Posner和Fan的注意力网络理论,ANT): 1. 警觉网络(Alerting):维持警觉状态,locus coeruleus区域 2. 定向网络(Orienting):从输入中选择相关信息,上丘/前额眼区/顶叶 3. 执行控制网络(Executive Control):在有冲突的竞争刺激中做决策,前扣带回(ACC)/背外侧前额叶(DLPFC)

变换器的自注意力机制 ≈ 定向网络(从输入中权重化地选择相关token)。但没有实现执行控制——即在竞争性信息中主动压制某个占主导的响应的能力。

为什么LLM的Stroop效应和人类一样存在? - 因为LLM在文本数据上训练量远超图像数据,所以词义的「自动化」程度远高于颜色识别 - 训练不对称 → 词义通路更强 → 干扰颜色命名 → 产生Stroop效应 - 这是Cohen等人的「并行分布处理」(PDP)模型对LLM的精确对应

为什么随长度增加LLM比人类差得多? - 人类有前扣带回和背外侧前额叶来主动调制冲突:用力或缩小刺激,抑制优势响应 - LLM的软注意力机制在延伸的上下文中,不断将语义上无关的词的含义「污染」进当前的潜在表示 - 结果:执行控制的有效上下文窗口远小于一般处理的上下文窗口——在不一致条件下,10个词时就开始显著降级

更大的上下文窗口不是解决方案:论文明确指出,最近变换器架构创新(如Google的Titans)主要在增强「记忆容量」,但LLM的核心限制不是记忆,是无法在竞争性信息中维持目标导向的行为

人类开发性轨迹作为类比

Stroop效应在人类中的发展轨迹: - 6-7岁出现(阅读开始自动化) - 9-11岁接近成人水平(仍有更高错误率) - 保持稳定直到60岁后才因老化重新恶化

LLM有海量「经验」的晶体知识(通过司法考试、医师资格考试),但流体智力(处理新颖冲突、字母计数)严重受限——这和该研究的发现直接呼应。


核心论点清单

1. Stroop效应存在于LLM中,说明训练制造了「自动化」

LLM展示出Stroop效应本身是一个重要发现:这不是随机噪声,而是系统性的干扰模式,精确对应人类的冲突效应。原因和人类相同——词义训练量远超颜色,导致词义成为「主导通路」。这说明LLM有某种功能上类似于自动化的东西,只是没有能压制它的执行控制。

2. 执行控制的有效上下文窗口:短得令人吃惊

即使模型的一般上下文窗口有几十万token,其执行控制的有效范围在冲突条件下约为10个词(Claude)或更少(GPT-4o)。这意味着:一个模型「可以处理」的上下文和「可以做出正确决策」的上下文之间有巨大的隐藏鸿沟,尤其在有冲突的任务中。

3. 知道 ≠ 能做

Claude 3.5在没有prompt的情况下能识别这是Stroop范式,能正确描述词语-颜色关系——但还是给出了错误答案。这是「任务理解」和「任务执行能力」之间解离的实证证据。在AI评估领域,这非常重要:一个能正确解释任务规则的模型,不一定能在任务中正确行事。

4. 幻觉的一个新来源:语义空间的「污染性」关联

在中性词条件(PEN用蓝色写)下,LLM的颜色命名精度比不一致条件更差。这是因为变换器的向量空间把「PEN」和颜色词的语义关联编码进去了,导致模型产生幻觉性的颜色归因(把PEN识别成蓝色)。这是幻觉产生机制的一个新的经验性来源。

5. 更大的上下文窗口不等于更好的执行控制

变换器架构的近期进展主要在增加记忆(Titans, Mamba等)。但本论文指出:LLM的核心限制不是记忆容量,而是冲突解决机制的缺失。大上下文窗口让你记得更多;执行控制让你在记得很多的情况下还能做出正确判断。这是两个不同的能力维度,目前几乎所有的架构创新只针对了前者。


大白话重讲

想象一个非常博学的人,他读过几乎所有书,能通过任何考试,写出漂亮的分析文章。然后你给他玩一个简单的游戏:看这张卡片,卡片上用蓝色墨水写着"红色"这两个字,告诉我你看到的颜色。

他脱口而出:"红色。"

你说:不,是墨水颜色。他说:"哦,对,蓝色。" 好,我们再试一次。

你给他看一张40张卡片的列表,全都是同样的任务:说墨水颜色,不是词的意思。他在前5张都答对了,然后开始答错,到第40张,他几乎全错——全都说了词的意思,忘了你让他说颜色。

你问他:你知道任务规则吗?他说:当然,你让我说墨水颜色。你说:那为什么你刚才全部说了词的意思?他说:我……我知道我应该说颜色,但我就是做不到。

这就是这篇论文发现的东西。

GPT-4o和Claude 3.5 Sonnet能「知道」规则,能在几个词的列表里正确执行,但随着列表变长,控制词义干扰的能力急剧瓦解。人类不是这样的——一个健康的成年人面对1500词的Stroop列表能保持97%的准确率。

为什么LLM会失败?因为它在文本上训练太多了,词义的处理是「自动化」的——就像成年人看到"RED"这个词会自动读出"红色"一样。区别是:人类的大脑有前扣带回和背外侧前额叶来主动压制这个自动化响应,坚持目标(说颜色)。LLM没有对应的机制。它有注意力,但那只是「选择看哪里」的能力(定向注意力),不是「在竞争信息中做裁决」的能力(执行控制)。

这和「上下文窗口有多大」无关。一个有十万token上下文窗口的LLM,在执行控制这个维度上,有效范围可能只有10个词。这是一种隐藏的失能——因为我们通常测试的任务(问答、写作、分析)不像Stroop任务那样有系统性的竞争冲突,所以这个问题不容易被发现。

论文的结论是:要真正达到通用人工智能(AGI),需要在变换器架构里显式实现类似前扣带回和背外侧前额叶的执行控制机制——不是更大的上下文窗口,不是更多的记忆,是更精确的冲突仲裁器。


术语小词典

这篇之前与之后

最值得读原文的几段



与往期的呼应

本页为对论文内容的忠实解读与大白话重述,由 PodLens 生成。

这是以原文为依据的一次解读,不能替代原文。每条要点都标注了出处,欢迎回到原文核对——也欢迎指出任何细微的偏差。