如果 LLM 有类人属性,那帝国时代II也有 · Adrian de Wynter
2026-06-24 · 由 PodLens 生成的忠实解读
原文:https://arxiv.org/pdf/2605.31514
拟人化基质非唯一性图灵完备计算心智理论科学哲学
这篇论文讲了什么
如果大语言模型(LLM)被认为具有"类人属性"——情感、自我意识、道德判断——那么任何足够强大的"基质"(substrate)理论上都可以呈现出同样的属性,包括《帝国时代II》这款1999年的即时战略游戏。这篇论文不是在争论 LLM 是否"真的"有这些属性,而是证明:当前研究界用来论证"LLM 有/没有类人属性"的实验设计,无论得出什么结论,在逻辑上都站不住脚——结论为"是"的实验是循环论证,结论为"否"的实验则毫无信息量。作者用三步论证支撑这个主张:(1) 在《帝国时代II》的游戏引擎内真实地构建并训练了一个神经网络感知器,并证明该游戏是功能完备且图灵完备的;(2) 用形式逻辑证明,在"接受"或"拒绝"某个心智理论框架(如计算心智理论)的前提下做实验,结论必然落入循环论证或无信息量两种失败模式;(3) 提出"零假设"方法论——不对系统是否具有拟人属性做任何先验假设,只测量可观察的行为本身。
论文骨架
- Abstract / Introduction:大量 LLM 研究宣称、默认或假设 LLM 具有泛化的拟人属性(如道德、自然语言理解)。作者的目标不是论证这些属性存在或不存在,而是指出:得出这类结论的论证方式可能本身就是错的。
- Background(§2):综述拟人化研究现状(包括用户对 LLM 产生依恋、过度信任、AI 被设计成说"我相信……""我感到……"等现象);介绍心智哲学背景(计算心智理论 CTM、连接主义、功能主义、扩展心智、具身认知);介绍科学哲学背景(Hempel 的科学解释理论、Popper 的可证伪主义、Duhem-Quine 论题);介绍《帝国时代II》的游戏规则(村民、资源、市场汇率上限9999金)。
- 在 AoEII 中训练一个感知器(§3):先证明《帝国时代II》的场景编辑器可以构建 NAND 门(引理1),由此推出该游戏是功能完备的(定理1)和图灵完备的(推论1);接着真实地在游戏内构建并训练了一个1比特感知器(perceptron)来学习 AND 运算。
- 拟人属性无法被测量(§4):论证在"接受 CTM"或"拒绝 CTM"任一前提下,实验结论要么是循环论证(结论早已被假设预先决定),要么是无信息量(无法判断是假设错了还是实验设计错了);提出"零假设"——停止对拟人属性的存在与否做任何先验判断,只测量"基于实现的行为"本身。
- 反对意见与回应(§5):逐一回应"心理测量学是否可以绕开这个问题""这和真正的 LLM 有什么区别""会不会这个论证本身太琐碎"等质疑,包括一个"大波士顿地区思想实验"(如果让66万波士顿居民模拟一个 LLM 的运算节点并互发短信传递信号,整个大波士顿地区会"焦虑"吗?)。
- 结论(§6):研究、宣称和政策制定都应该谨慎审视实验的前提假设和结论的适用范围;拟人化的感知程度很大程度上取决于界面呈现(聊天窗口低延迟高连贯 vs. 游戏内羊群缓慢移动),而非系统行为本身;引用并改写 Morgan's Canon(动物认知研究中的简约原则):不应用更高级的认知过程来解释机器的行为,如果用更低级的过程就能合理解释。
核心论点清单
- LLM 的拟人化特质并非 LLM 独有,因为足够强大的"基质"本身可以承载这些特质。 改变实现基质会保留 LLM 的某些性质(如提示词到输出的映射),但不会保留其"去人性化"的质感——这意味着对拟人特质的感知是依赖表征方式的,不是基质独有的本质属性。
- 锚点:Abstract · "the purported anthropomorphic attributes of LLMs are empirically non-unique"
- 类型:理论论证
- 《帝国时代II》在数学上被证明是功能完备且图灵完备的,因此理论上可以在其内部构建任何神经网络。 作者证明该游戏的场景编辑器可以用两个单位和一名玩家构建 NAND 门,并真实地在游戏内构建并训练了一个学习 AND 运算的1比特感知器。
- 锚点:§3.1 Theorem 1 / Corollary 1 · "AoEII is Functionally Complete" / "AoEII is Turing-Complete"
- 类型:数学证明
- 无论科学家先验地"接受"还是"拒绝"某个心智理论框架,关于 LLM 拟人属性是否存在的实验结论都逃不出两种失败模式之一。 如果假设和结论本质上是同一个主张,正面结果只是循环论证;负面结果则无法区分是假设错了还是实验本身设计有问题——这种模糊性同样适用于多组假设-实验对的情况。
- 锚点:§4.2 · "positive outcomes... provide evidence that the hypothesis is true, and concluded that the assumptions were true. This is a circular argument" / "a negative experiment... ambiguous outcome where it is not possible to distinguish which failure mode led to the conclusion"
- 类型:逻辑论证
- 对2024年中至2026年中发布的315篇相关论文的文献综述显示,方法论问题具有普遍性。 57%的论文从"LLM 具有拟人属性"的假设出发,其中36%最终得出肯定结论;在以 LLM 拟人属性为研究中心的47篇论文(占15%)中,77%得出了肯定结论。
- 锚点:§2.1 · "57% of these began with the assumption that LLMs have anthropomorphic attributes, and out of these, 36% conclude so... the conclusions were often on the side of anthropomorphism (36, or 77%)"
- 类型:文献综述数据
- 作者提出"零假设"方法:不对系统是否具有拟人属性做任何先验判断,只测量可观察的行为本身,并把"对模式的观察"和"对模式的归因"区分开。 例如 LLM 能生成自然语言解释是一个可观察事实;这是否构成对内部状态的"理解"则是一种拟人归因,二者不应混为一谈。
- 锚点:§4.3 · "one must distinguish between an observation of a pattern, and its ascription"
- 类型:方法论提案
- 拟人化程度的感知很大程度上取决于界面呈现,而非底层系统行为本身。 同样的输入输出行为,包装在低延迟、高连贯性的聊天窗口里,比包装在《帝国时代II》里缓慢移动的羊群里,会显得"更像人"得多——很多对 AI 拟人化的测量,测的其实是呈现方式,而不是系统本身的行为。
- 锚点:§6 Conclusion · "many anthropomorphic measurements in AI are measurements of presentation, rather than of an actual system's behaviour"
- 类型:结论性论证
大白话重讲
设想这样一个荒诞场景:你把一个大语言模型的核心运算逻辑,原原本本搬进《帝国时代II》——用游戏里的羊群、村民、资源市场来实现同样的输入输出映射。你问这个"帝国时代-LLM":"我感到很孤独",它用游戏内某种约定的方式回复:"我为你感到难过,也许该联系一下朋友?亲密关系总是有帮助的。"
这个回复让你很难说清楚:这个由羊群和资源价格构成的系统,到底"知道"什么对孤独有帮助吗?它"真的"有同理心吗?还是说它的输出只是因为你恰好能读懂这套表征方式?
这正是这篇论文的核心论证起点。作者认为:之所以这个问题让人为难,恰恰是因为拟人特质这种东西,本质上依赖于"表征方式",而不是系统底层做了什么运算。同样的逻辑运算,包在一个低延迟、说人话的聊天框里,看起来"像人";包在一群在草地上来回走动的虚拟羊里,看起来一点也不像人——但底层运算可能完全一样。这意味着:LLM 表现出的拟人属性,从经验上来说并不是 LLM "独有"的,任何足够强大的基质都可以承载同样的运算,只是表征方式会改变人类对它的解读。
为了让这个论点不只是一个思想实验,作者真的动手做了一件事:他在《帝国时代II》的场景编辑器里,用游戏自带的单位和地形规则,搭建了一个 NAND 逻辑门——这是数字电路里"万能"的基础积木,理论上只要有足够的 NAND 门,就能拼出任何计算电路。基于这个 NAND 门,作者证明了《帝国时代II》是"功能完备"且"图灵完备"的——意味着理论上你可以在这个游戏里构建出任何一台计算机能做的计算,当然也包括一个神经网络。作者真的在游戏里训练了一个简化版的感知器(最基础的神经网络单元),让它学会了"与"(AND)这个逻辑运算。这不是比喻,是一个可以运行、可以复现的真实构造。
接下来是论文最锋利的部分。假设有个科学家想搞清楚:"LLM 到底有没有真正的拟人属性?"她得先选一个立场:要么假设"心智是一种信息处理系统"(计算心智理论,CTM)成立,要么拒绝它。无论选哪一边,作者用形式逻辑证明:实验结果只有两种可能,而两种都没用。如果选择"接受 CTM",那"拟人属性存在"这个假设和"实验得到正面结果"这个结论,本质上是同一句话换了个说法——这是循环论证,证明不了任何独立的东西。如果实验得到负面结果,你又没法判断是"假设错了"还是"实验设计本身有问题"——这是无信息量的结果。把这套逻辑推广到很多篇论文、很多组假设的情况下,结论依然成立:只要论证的起点里已经包含了你要证明的东西,无论做多少实验,都走不出这个循环。
那怎么办?作者提出一个叫"零假设"的解法:彻底放弃去判断"这个系统到底有没有拟人属性",只去测量它在具体条件下"做了什么",不去诠释这个行为背后有没有"真正的理解"或"真正的情感"。比如 LLM 会生成解释自己行为的文字——这是一个可以被观察、被复现的事实;但这段文字是否代表它"理解"了自己的内部状态,是一个额外的、不该被默认接受的诠释。把"观察到的模式"和"对这个模式的归因"分开,结论会更弱(不能说"LLM 有自我意识"),但更扎实(可以说"在这个具体任务下,LLM 表现出某种一致的行为模式")。
作者还设计了一个有点黑色幽默的思想实验来强化这一点:假如把大波士顿地区66万居民动员起来,每个人代表 LLM 神经网络里的一个节点,互相用短信传递运算的输入输出——这个由人组成的巨型计算网络,最终会"感到焦虑"吗?还是说,焦虑只存在于某条具体的短信内容里?还是存在于走进某个地址(比如某个对应"输出层"的街区)的那群人身上?作者的答案是:这个问题本身问错了——你不能在不做任何假设的前提下,去问"这个系统有没有拟人属性",因为这个问题的答案完全取决于你一开始悄悄接受了哪个心智理论立场。
论文最后引用并改写了一条来自动物认知研究的经典原则(Morgan's Canon):永远不要用更高级的认知过程去解释一个行为,如果用更低级的过程就足够解释它。作者的落脚点很克制:他没有说 LLM 一定没有情感或意识,而是说——在没有讲清楚测量标准之前,"LLM 表现出了类人特质"这句话,和"《帝国时代II》里的羊群表现出了类人特质"一样,都说明不了什么。
术语小词典
拟人化 / 拟人归因(Anthropomorphism / Anthropomorphic Ascription): 把人类心智特质(情感、意图、理解力)赋予非人类实体的倾向。论文区分"系统表现出某种行为模式"(可观察事实)和"这个模式代表了某种内在心智属性"(一种诠释/归因)。
基质非唯一性(Substrate Non-Uniqueness): 论文的核心论点——LLM 表现出的拟人特质,在经验上并不是 LLM 独有的,因为同样的输入输出行为可以在不同的"基质"(硬件/实现方式)上重现,只是表征方式会改变观察者对它的解读。
计算心智理论(Computational Theory of Mind, CTM): 心智哲学中的一类观点,认为心智本质上是一种信息处理/计算系统。论文用"接受 CTM"或"拒绝 CTM"作为科学家在设计拟人属性实验时必须预先选定的立场示例(任何同类框架都适用)。
功能完备 / 图灵完备(Functionally Complete / Turing-Complete): 功能完备指一组逻辑运算(如 NAND)可以组合出任何布尔函数;图灵完备指一个系统理论上可以模拟任意图灵机、执行任何可计算的运算。论文证明《帝国时代II》同时满足这两个性质。
循环论证 vs. 无信息量结论(Circular vs. Uninformative): 论文用形式逻辑刻画的两种实验失败模式——循环论证指实验的"证据"和它要证明的"假设"本质上是同一个主张;无信息量指实验结果无法区分究竟是原始假设错了,还是实验设计本身出了问题。
零假设(Null Assumption): 这篇论文提出的方法论——区别于统计学里的"零假设/原假设",这里指研究者在测量拟人属性时,不对其存在或不存在做任何先验判断,只测量"基于具体实现的可观察行为"本身。
这篇之前与之后
之前 (Preceding Works)
大量 LLM 研究(论文综述了2024年中至2026年中的315篇相关工作)默认或明确假设 LLM 具有拟人属性——合作能力、共情、心理学原则与价值观、内省与自我意识、对自然语言的理解、焦虑、欺骗能力等。部分研究甚至将这些特质明确称为"涌现行为"(emergent behaviour),而非训练的产物。AI 公司也在主动设计层面强化这种感知,让聊天机器人说出"我很自信""我能理解并回应你的情绪""我相信……"之类的语句,这背后有改善用户体验的商业动机,但也带来了用户产生依恋、过度依赖、被强化妄想等已被记录的危害。
之后 (Succeeding Lines)
论文的核心隐含要求是:任何关于 LLM 是否具有泛化拟人属性的研究、宣称或政策讨论,都需要明确陈述其实验的假设范围和结论的适用边界,而不能从一个隐含或明确的"接受/拒绝"立场直接跳到"这个属性存在/不存在"的泛化结论。这也意味着,未来的评估应该把"AI 客观上能做什么"(可测试的能力)和"实验者认为它应该是什么"(拟人归因)明确分开处理。
最值得读原文的几段
- Abstract:
"For this we build and train a simple neural network on the video game Age of Empires II, and note that any entity in a sufficiently-powerful substrate, such as LEGO or the Greater Boston Area, could also present such attributes."
- 核心意义:一句话讲清了全文最核心、最反直觉的论证策略——用一个荒诞但严格构造的反例,揭示"LLM 拟人属性"论证里被忽略的基质依赖性。
- §5.2("大波士顿地区"思想实验):
"we also construct a physical system, in, say, the Greater Boston Area, which has 667,137 inhabitants... Would the Greater Boston Area present human-like attributes (excluding these in the 'neurones') through autoregression? ... we do note that one cannot begin an evaluation of such a system by assuming that it has them intrinsically."
- 核心意义:用一个夸张到接近喜剧的设定,把"基质独立性"这个抽象哲学论证变成了一个可以被直觉理解的画面。
- §6 Conclusion(Morgan's Canon 改写):
"Paraphrasing and adapting Morgan (1903)'s canon from animal cognition into AI, we argue that in no case is a machine's activity to be interpreted in terms of higher cognitive processes, if it can be fairly interpreted in terms of processes which stand lower in the scale of cognitive evolution and development."
- 核心意义:把全篇技术性的逻辑论证,落回到一条简洁、可操作的研究伦理原则上——这条原则原本是为了防止研究者过度诠释动物行为,现在被作者主张同样适用于 AI。
与往期的呼应
- 同构→ AI 拟人化对信任与责任的影响 · Victoria Oldemburgo de Mello et al.
两篇论文从两个方向论证同一件事:LLM 是否「真的」拥有人类特质,和人类是否会「表现得像」它拥有人类特质,是两个完全独立的问题——而真正有后果的是后者。de Wynter 的论文证明:任何足够复杂的系统都可以被观察者解读出拟人化特质,说明这些特质依赖于表征方式,不是 LLM 独有的本质属性。Oldemburgo de Mello 等人的论文证明了这一点的现实后果:不管 AI 是否真的有情感,只要它表现得「像」有情感共鸣,用户的信任和责任归因就会被系统性地改变——而且这种改变可以被设计利用。
本期Abstract · "the purported anthropomorphic attributes of LLMs are empirically non-unique: although some properties (e.g., responses to prompts) could remain invariant, others, such as the interpretation of their perceived behaviour, might change with the substrate."
往期Abstract · "anthropomorphism simultaneously increases user trust while deflecting accountability from developers. These dynamics create a responsibility gap with significant implications for AI governance and institutional accountability."
- 同构→ P vs NP、零知识证明与计算的胚胎阶段 · Avi Wigderson
两篇论文都在用严格的形式逻辑,划出「什么可以被证明」和「什么本质上证明不了任何东西」之间的边界。de Wynter 证明:在「接受/拒绝」某个心智理论框架的前提下,关于 LLM 拟人属性是否存在的实验结论,无论正面还是负面,都逃不出循环论证或无信息量两种失败模式——这本身就是一种复杂性/可证明性的结果。Wigderson 整场访谈的核心也是同一类问题:哪些数学/计算命题原则上可以被证明或验证(零知识证明的普适性、P vs NP),哪些即使穷尽努力依然停留在「我们就是不知道」(乘法是否真的比加法更难)。两人都在说:弄清楚一个问题「能不能在当前框架下被回答」,本身就是和回答这个问题同样重要的工作。
本期§4.2 · "positive outcomes... provide evidence that the hypothesis is true, and concluded that the assumptions were true. This is a circular argument... a negative experiment... [is] an uninformative/ambiguous outcome."
往期[02:07:08] Wigderson 说我们仍然不知道乘法是否比加法更难,P vs NP 问题在他整个职业生涯中没有实质性进展——理论计算机科学家的日常是失败,乐趣在于思考本身,大发现极其稀有。
- 同构← AI 拟人化对信任与责任的影响 · Victoria Oldemburgo de Mello et al.
两篇论文从两个方向论证同一件事:LLM 是否「真的」拥有人类特质,和人类是否会「表现得像」它拥有人类特质,是两个完全独立的问题——而真正有后果的是后者。de Wynter 的论文证明:任何足够复杂的系统(哪怕是一个在《帝国时代II》上训练的简单神经网络)都可以被观察者解读出拟人化特质,说明这些特质是「表征层面」的产物,不是 LLM 独有的本质属性。Oldemburgo de Mello 等人的论文证明了这一点的现实后果:不管 AI 是否真的有情感,只要它表现得「像」有情感共鸣,用户的信任和责任归因就会被系统性地改变——而且这种改变是可以被公司设计利用的。
本期Abstract · "anthropomorphism simultaneously increases user trust while deflecting accountability from developers. These dynamics create a responsibility gap with significant implications for AI governance and institutional accountability."
往期Abstract · "the purported anthropomorphic attributes of LLMs are empirically non-unique: although some properties (e.g., responses to prompts) could remain invariant, others, such as the interpretation of their perceived behaviour, might change with the substrate."
这是以原文为依据的一次解读,不能替代原文。每条要点都标注了出处,欢迎回到原文核对——也欢迎指出任何细微的偏差。