English

如果 LLM 有类人属性,那帝国时代II也有 · Adrian de Wynter

2026-06-24 · 由 PodLens 生成的忠实解读

原文:https://arxiv.org/pdf/2605.31514

拟人化基质非唯一性图灵完备计算心智理论科学哲学

这篇论文讲了什么

如果大语言模型(LLM)被认为具有"类人属性"——情感、自我意识、道德判断——那么任何足够强大的"基质"(substrate)理论上都可以呈现出同样的属性,包括《帝国时代II》这款1999年的即时战略游戏。这篇论文不是在争论 LLM 是否"真的"有这些属性,而是证明:当前研究界用来论证"LLM 有/没有类人属性"的实验设计,无论得出什么结论,在逻辑上都站不住脚——结论为"是"的实验是循环论证,结论为"否"的实验则毫无信息量。作者用三步论证支撑这个主张:(1) 在《帝国时代II》的游戏引擎内真实地构建并训练了一个神经网络感知器,并证明该游戏是功能完备且图灵完备的;(2) 用形式逻辑证明,在"接受"或"拒绝"某个心智理论框架(如计算心智理论)的前提下做实验,结论必然落入循环论证或无信息量两种失败模式;(3) 提出"零假设"方法论——不对系统是否具有拟人属性做任何先验假设,只测量可观察的行为本身。

论文骨架

核心论点清单

  1. LLM 的拟人化特质并非 LLM 独有,因为足够强大的"基质"本身可以承载这些特质。 改变实现基质会保留 LLM 的某些性质(如提示词到输出的映射),但不会保留其"去人性化"的质感——这意味着对拟人特质的感知是依赖表征方式的,不是基质独有的本质属性。 - 锚点:Abstract · "the purported anthropomorphic attributes of LLMs are empirically non-unique" - 类型:理论论证
  2. 《帝国时代II》在数学上被证明是功能完备且图灵完备的,因此理论上可以在其内部构建任何神经网络。 作者证明该游戏的场景编辑器可以用两个单位和一名玩家构建 NAND 门,并真实地在游戏内构建并训练了一个学习 AND 运算的1比特感知器。 - 锚点:§3.1 Theorem 1 / Corollary 1 · "AoEII is Functionally Complete" / "AoEII is Turing-Complete" - 类型:数学证明
  3. 无论科学家先验地"接受"还是"拒绝"某个心智理论框架,关于 LLM 拟人属性是否存在的实验结论都逃不出两种失败模式之一。 如果假设和结论本质上是同一个主张,正面结果只是循环论证;负面结果则无法区分是假设错了还是实验本身设计有问题——这种模糊性同样适用于多组假设-实验对的情况。 - 锚点:§4.2 · "positive outcomes... provide evidence that the hypothesis is true, and concluded that the assumptions were true. This is a circular argument" / "a negative experiment... ambiguous outcome where it is not possible to distinguish which failure mode led to the conclusion" - 类型:逻辑论证
  4. 对2024年中至2026年中发布的315篇相关论文的文献综述显示,方法论问题具有普遍性。 57%的论文从"LLM 具有拟人属性"的假设出发,其中36%最终得出肯定结论;在以 LLM 拟人属性为研究中心的47篇论文(占15%)中,77%得出了肯定结论。 - 锚点:§2.1 · "57% of these began with the assumption that LLMs have anthropomorphic attributes, and out of these, 36% conclude so... the conclusions were often on the side of anthropomorphism (36, or 77%)" - 类型:文献综述数据
  5. 作者提出"零假设"方法:不对系统是否具有拟人属性做任何先验判断,只测量可观察的行为本身,并把"对模式的观察"和"对模式的归因"区分开。 例如 LLM 能生成自然语言解释是一个可观察事实;这是否构成对内部状态的"理解"则是一种拟人归因,二者不应混为一谈。 - 锚点:§4.3 · "one must distinguish between an observation of a pattern, and its ascription" - 类型:方法论提案
  6. 拟人化程度的感知很大程度上取决于界面呈现,而非底层系统行为本身。 同样的输入输出行为,包装在低延迟、高连贯性的聊天窗口里,比包装在《帝国时代II》里缓慢移动的羊群里,会显得"更像人"得多——很多对 AI 拟人化的测量,测的其实是呈现方式,而不是系统本身的行为。 - 锚点:§6 Conclusion · "many anthropomorphic measurements in AI are measurements of presentation, rather than of an actual system's behaviour" - 类型:结论性论证

大白话重讲

设想这样一个荒诞场景:你把一个大语言模型的核心运算逻辑,原原本本搬进《帝国时代II》——用游戏里的羊群、村民、资源市场来实现同样的输入输出映射。你问这个"帝国时代-LLM":"我感到很孤独",它用游戏内某种约定的方式回复:"我为你感到难过,也许该联系一下朋友?亲密关系总是有帮助的。"

这个回复让你很难说清楚:这个由羊群和资源价格构成的系统,到底"知道"什么对孤独有帮助吗?它"真的"有同理心吗?还是说它的输出只是因为你恰好能读懂这套表征方式?

这正是这篇论文的核心论证起点。作者认为:之所以这个问题让人为难,恰恰是因为拟人特质这种东西,本质上依赖于"表征方式",而不是系统底层做了什么运算。同样的逻辑运算,包在一个低延迟、说人话的聊天框里,看起来"像人";包在一群在草地上来回走动的虚拟羊里,看起来一点也不像人——但底层运算可能完全一样。这意味着:LLM 表现出的拟人属性,从经验上来说并不是 LLM "独有"的,任何足够强大的基质都可以承载同样的运算,只是表征方式会改变人类对它的解读。

为了让这个论点不只是一个思想实验,作者真的动手做了一件事:他在《帝国时代II》的场景编辑器里,用游戏自带的单位和地形规则,搭建了一个 NAND 逻辑门——这是数字电路里"万能"的基础积木,理论上只要有足够的 NAND 门,就能拼出任何计算电路。基于这个 NAND 门,作者证明了《帝国时代II》是"功能完备"且"图灵完备"的——意味着理论上你可以在这个游戏里构建出任何一台计算机能做的计算,当然也包括一个神经网络。作者真的在游戏里训练了一个简化版的感知器(最基础的神经网络单元),让它学会了"与"(AND)这个逻辑运算。这不是比喻,是一个可以运行、可以复现的真实构造。

接下来是论文最锋利的部分。假设有个科学家想搞清楚:"LLM 到底有没有真正的拟人属性?"她得先选一个立场:要么假设"心智是一种信息处理系统"(计算心智理论,CTM)成立,要么拒绝它。无论选哪一边,作者用形式逻辑证明:实验结果只有两种可能,而两种都没用。如果选择"接受 CTM",那"拟人属性存在"这个假设和"实验得到正面结果"这个结论,本质上是同一句话换了个说法——这是循环论证,证明不了任何独立的东西。如果实验得到负面结果,你又没法判断是"假设错了"还是"实验设计本身有问题"——这是无信息量的结果。把这套逻辑推广到很多篇论文、很多组假设的情况下,结论依然成立:只要论证的起点里已经包含了你要证明的东西,无论做多少实验,都走不出这个循环。

那怎么办?作者提出一个叫"零假设"的解法:彻底放弃去判断"这个系统到底有没有拟人属性",只去测量它在具体条件下"做了什么",不去诠释这个行为背后有没有"真正的理解"或"真正的情感"。比如 LLM 会生成解释自己行为的文字——这是一个可以被观察、被复现的事实;但这段文字是否代表它"理解"了自己的内部状态,是一个额外的、不该被默认接受的诠释。把"观察到的模式"和"对这个模式的归因"分开,结论会更弱(不能说"LLM 有自我意识"),但更扎实(可以说"在这个具体任务下,LLM 表现出某种一致的行为模式")。

作者还设计了一个有点黑色幽默的思想实验来强化这一点:假如把大波士顿地区66万居民动员起来,每个人代表 LLM 神经网络里的一个节点,互相用短信传递运算的输入输出——这个由人组成的巨型计算网络,最终会"感到焦虑"吗?还是说,焦虑只存在于某条具体的短信内容里?还是存在于走进某个地址(比如某个对应"输出层"的街区)的那群人身上?作者的答案是:这个问题本身问错了——你不能在不做任何假设的前提下,去问"这个系统有没有拟人属性",因为这个问题的答案完全取决于你一开始悄悄接受了哪个心智理论立场。

论文最后引用并改写了一条来自动物认知研究的经典原则(Morgan's Canon):永远不要用更高级的认知过程去解释一个行为,如果用更低级的过程就足够解释它。作者的落脚点很克制:他没有说 LLM 一定没有情感或意识,而是说——在没有讲清楚测量标准之前,"LLM 表现出了类人特质"这句话,和"《帝国时代II》里的羊群表现出了类人特质"一样,都说明不了什么。

术语小词典

拟人化 / 拟人归因(Anthropomorphism / Anthropomorphic Ascription): 把人类心智特质(情感、意图、理解力)赋予非人类实体的倾向。论文区分"系统表现出某种行为模式"(可观察事实)和"这个模式代表了某种内在心智属性"(一种诠释/归因)。

基质非唯一性(Substrate Non-Uniqueness): 论文的核心论点——LLM 表现出的拟人特质,在经验上并不是 LLM 独有的,因为同样的输入输出行为可以在不同的"基质"(硬件/实现方式)上重现,只是表征方式会改变观察者对它的解读。

计算心智理论(Computational Theory of Mind, CTM): 心智哲学中的一类观点,认为心智本质上是一种信息处理/计算系统。论文用"接受 CTM"或"拒绝 CTM"作为科学家在设计拟人属性实验时必须预先选定的立场示例(任何同类框架都适用)。

功能完备 / 图灵完备(Functionally Complete / Turing-Complete): 功能完备指一组逻辑运算(如 NAND)可以组合出任何布尔函数;图灵完备指一个系统理论上可以模拟任意图灵机、执行任何可计算的运算。论文证明《帝国时代II》同时满足这两个性质。

循环论证 vs. 无信息量结论(Circular vs. Uninformative): 论文用形式逻辑刻画的两种实验失败模式——循环论证指实验的"证据"和它要证明的"假设"本质上是同一个主张;无信息量指实验结果无法区分究竟是原始假设错了,还是实验设计本身出了问题。

零假设(Null Assumption): 这篇论文提出的方法论——区别于统计学里的"零假设/原假设",这里指研究者在测量拟人属性时,不对其存在或不存在做任何先验判断,只测量"基于具体实现的可观察行为"本身。

这篇之前与之后

之前 (Preceding Works)

大量 LLM 研究(论文综述了2024年中至2026年中的315篇相关工作)默认或明确假设 LLM 具有拟人属性——合作能力、共情、心理学原则与价值观、内省与自我意识、对自然语言的理解、焦虑、欺骗能力等。部分研究甚至将这些特质明确称为"涌现行为"(emergent behaviour),而非训练的产物。AI 公司也在主动设计层面强化这种感知,让聊天机器人说出"我很自信""我能理解并回应你的情绪""我相信……"之类的语句,这背后有改善用户体验的商业动机,但也带来了用户产生依恋、过度依赖、被强化妄想等已被记录的危害。

之后 (Succeeding Lines)

论文的核心隐含要求是:任何关于 LLM 是否具有泛化拟人属性的研究、宣称或政策讨论,都需要明确陈述其实验的假设范围和结论的适用边界,而不能从一个隐含或明确的"接受/拒绝"立场直接跳到"这个属性存在/不存在"的泛化结论。这也意味着,未来的评估应该把"AI 客观上能做什么"(可测试的能力)和"实验者认为它应该是什么"(拟人归因)明确分开处理。

最值得读原文的几段


与往期的呼应

本页为对论文内容的忠实解读与大白话重述,由 PodLens 生成。

这是以原文为依据的一次解读,不能替代原文。每条要点都标注了出处,欢迎回到原文核对——也欢迎指出任何细微的偏差。