表层数据与深层数据 · Alexei Efros
2026-06-14 · 由 PodLens 生成的忠实解读
原节目:https://www.youtube.com/live/vk6lgHjjGp8?si=5F0NXJlFZ_LtNfgm · 时间戳可点击,就地跳转播放器
具身智能好奇心驱动深层数据机器人世界模型
这期讲了什么
这是 UC Berkeley 计算机视觉教授 Alexei Efros(Alyosha)在一场学术研讨会上的演讲,他是 Shiri 的博士导师,与 Alison Gopnik、Jitendra Malik、Phil Isola 等人同处一个多日工作坊。演讲的核心问题非常直接:Rich Sutton 2019 年的"苦涩的教训"究竟苦在哪里?计算(Compute)真的能替代数据(Data)吗?Efros 的答案是:这堂课根本不苦,而且方向搞错了。
Efros 的核心论题是数据先于计算。他借用一个物理学直觉切入:我们想建模的不是"任意一个可能世界",而是这个世界——这个特定的、从大爆炸经由恐龙灭绝一路到今天的世界。这个世界之所以是它自己,靠的是一串不可还原的"硬币翻转"(coin flips)——那些随机性决策构成的熵向量,是宇宙对我们世界的签名。无论你有多少 GPU 从第一性原理模拟,都无法从计算中生成这个向量;它只存在于数据里。因此,数据不是计算可以替代的资源,而是不可约的基础。
但光有数据还不够,还要看什么类型的数据。演讲的第二个核心区分是表层数据(Surface Data)与深层数据(Deep Data):表层数据是被动刮取的,是文本、像素、音频信号,是你坐着就能拿到的;深层数据是需要主动挖掘的,是那把刀的重量、那杯液体的粘稠度、那台 Mac 的开盖方向——只有通过亲身互动才能获得的数据。婴儿是深层数据矿工的原型:他们把每样东西都放进嘴里,就是在主动采集味觉数据。而当前 AI(包括大语言模型、图像扩散模型)本质上都在刮表层数据,这是它们能做到魔法级别的插值和模仿,却无法真正外推的根本原因。
演讲的第三层是出路:好奇心驱动的具身探索。Efros 和 Deepak Pathak 在 2017 年做过一个无奖励学习 Mario 的工作,把好奇心定义为预测误差——预测不准的地方就是值得探索的地方。这产生了一个飞轮:数据→能力→更好的数据。他的愿景是"婴儿科学家机器人"(Robot Scientist in the Crib):目标不是完成任何任务,而是专职挖掘深层数据。他认为这是走向真正 AI 的必经之路。
时间线主题地图
- [00:00-01:04] 会议主持人介绍 Alexei Efros(Alyosha),他是 Shiri 的博士导师,提到这次演讲是对 Alison 早些时候演讲的"押韵"。
- [01:04-03:30] 重新审视"苦涩的教训"(Rich Sutton 2019)。Efros 认为这堂课根本不苦:Darwin 推翻 Linnaeus 的分类学、Newton 统一物理学——简洁性是科学的目标,不是损失。
- [03:30-05:10] 苦涩的教训真正指向的是人类自身的认知降级:我们其实比我们以为的更简单,99% 的时间只是"最近邻机器"(stochastic parrots),只有偶尔才有真正的创造性飞跃。
- [05:10-09:35] 核心论证:数据先于计算。Sutton 的宣言提到计算 21 次,数据只一次。Efros 批评了"数据与计算可以互换"的观点——这对建模"任意世界"可能成立,但对建模"我们的世界"根本不行。
- [09:35-10:52] 不可约熵(Irreducible Entropy)论证:恐龙灭绝、进化路径上每一次随机决策构成的向量,是我们世界的签名,无法从第一性原理推导,只能从数据中注入。
- [10:52-12:12] 计算是次要的,是"触碰所有数据所需的最小工具"——你至少需要 O(N) 的计算,但没有数据的计算完全无用。
- [12:12-14:57] 图像生成模型的数据归因实验:一张合成图像可以追溯到 LAION 训练集中 6 张最有影响力的真实图像;现代扩散模型本质上是高维空间中的纹理合成(texture synthesis)。
- [14:57-17:25] Neural Thickets 论文介绍:在一个充分预训练的大模型权重空间中随机漫步,可以采样到比原模型更擅长特定任务(数学、编程)的子模型——无需微调,无需新数据。这说明数据已经全部在预训练阶段注入。
- [17:25-19:00] 后训练(Post-training)的再诠释:知识已经全在模型里,后训练只是告诉它"这次考的是物理还是化学"——如同考前一夜派对,第一道题就能帮你回忆起这是哪门课。
- [19:00-21:05] 引入 Alison Gopnik 的"AI 作为文化技术"框架,以及 Phil Isola 的 Data++ 概念:生成模型不是在创造新东西,而是把数据和控制压缩在同一个模型里,本质上是极强的插值器。
- [21:05-23:05] "真正 AI 的两个必要成分":(1) 数据焦点而非算法焦点;(2) 突现目标(Emergent Objective)——AI 是当计算机"想写诗",而不只是"能写诗"的时候。
- [23:05-27:30] 表层数据 vs 深层数据的核心区分。表层数据:被动刮取的文本、像素、音频。深层数据:只有通过主动互动才能获得的——刀的重量、液体的粘稠度、Mac 的开盖方向。婴儿是深层数据矿工,把一切都放进嘴里。
- [27:30-29:10] 用 Moravec 悖论引入具身问题:棋类 AI 30 年前就解决了,但今天没有机器人能像人类那样移动棋子。判断初创公司成败的最简算法:看数据有多少——文本数据丰富,图像数据在追,视频数据稀疏,机器人数据"几乎为零"。
- [29:10-31:45] 机器人数据的双重问题:(1) 数量极少;(2) 质量错误——都是被动刮取,既无负样本,也无具身反馈。物理世界会"推回来",语言可以是后现代主义,但机器人摔东西就是摔东西。
- [31:45-34:20] 好奇心驱动的探索框架(2017 年 Pathak 合作工作):好奇心=预测误差;无奖励学习 Mario;这是"Yann 之前就存在的世界模型"——在特征空间中做预测,配合逆模型学习特征表示,即 pre-JEPA。
- [34:20-35:30] Mario 实验结果:无奖励的 Mario 学会了存活、杀敌、前进,因为这些是"有趣"的事;乒乓球实验中目标不是得分,而是保持回合——更有趣的事。
- [35:30-37:00] 好奇心应用于扩散模型和文本数据的网络探索;目前在真实机器人上仍未能稳定运行,但方向是对的。
- [37:00-38:30] 总结:表层数据足以实现一些魔法,但会止步于模仿与拼贴;深层数据飞轮是出路;好奇心/内在动机/赋能(empowerment)是获取深层数据的机制。宣言:"不要问数据能为你的机器人做什么,要问你的机器人能为数据做什么。"
- [38:30-46:00] 问答环节:关于表层数据能否部分转化为深层数据(Socrates 的"知识幻觉"回应);深层数据 plus plus(有感受的知识 vs 对知识的认知);对"AI 无法创造"论断缺乏充分实证的批评;Jitendra Malik 关于 Gibsonian 主动感知的提问;Alison Gopnik 关于 RL 与深层数据关系的分析;关于具身化是否必要的最后问答。
核心观点清单
-
苦涩的教训并不苦——简洁性是科学的目标,达尔文和牛顿都是在"更简单",不是在"失去"。 [01:04-02:50] | 类型:观点 | 备注:Efros 认为真正苦涩的是对人类自身的重新定位:我们比我们以为的更简单,更像是随机拼贴机器。
-
不可约熵论证:我们的世界之所以是它自己,是因为一串无法从第一性原理推导的随机决策向量,这只能从数据中注入,无法用计算生成。 [06:55-08:39] | 类型:论证 | 备注:这是对"数据与计算可互换"论点的哲学级别反驳;Efros 明确说计算机图形学 25 年前犯了同样的错误——以为知道了所有物理就能渲染一切,结果因为缺乏数据的熵注入而失败。
-
计算是次要资源:你需要 O(N) 计算来"触碰"所有数据,但没有数据的计算是完全无用的。 [09:05-09:38] | 类型:观点 | 备注:这是数据优先论的操作性定义——计算是服务于数据的工具,不是可以替代数据的等价物。
-
现代扩散模型本质上是高维空间中的纹理合成,在像素 patch 层面做最近邻搜索并拼合,并非生成真正的新内容。 [12:12-12:45] | 类型:事实 | 备注:引用了 Surya 的理论论文——扩散模型等同于纹理合成;Neural Thickets 进一步论证预训练阶段已注入全部知识,后训练只是"告诉模型考的是哪门课"。
-
表层数据与深层数据的本质区分:表层数据是被动接收的信息(文本、像素、音频);深层数据是需要主动挖掘、通过具身互动才能获得的信息(重量、粘稠度、触感、物理因果)。 [22:01-25:10] | 类型:区分/框架 | 备注:婴儿通过把一切放进嘴里来采集味觉深层数据——"你小时候也把这房间里的所有东西放进嘴里过";Socrates 对书本的批评与此同构:"你为学生提供的是智慧的外表,而非实质。"
-
机器人领域存在双重数据危机:数量为零,且现有数据种类错误(被动遥操作,无负样本,无具身推回)。 [20:15-21:32] | 类型:事实 | 备注:与语言不同,物理世界会推回:语言的最坏情况是"听起来像詹姆斯·乔伊斯";但机器人摔东西就是损失。
-
好奇心 = 预测误差:驱动具身探索的内在动机可以定义为"我无法预测的事物",这产生自然课程(natural curriculum)和终身学习的飞轮。 [30:54-31:06] | 类型:框架 | 备注:2017 年与 Pathak 的合作——无奖励 Mario 学习。Efros 明确说这是"Yann 之前就存在的世界模型(pre-JEPA)",在特征空间中做预测并同时学习特征表示。
-
深层数据飞轮:数据→能力→获取更好数据的能力→更好的数据,并具备自然难度递增的课程。 [26:01-26:21] | 类型:框架 | 备注:现有机器人训练路径(遥操作、模拟、视频学习)都在飞轮之外——遥操作缺乏规模和负样本,模拟缺乏现实性且面临"同样的熵注入问题",视频学习缺乏具身性。
-
RL 处于深层数据挖掘的"一半"位置:它确实在挖掘深层数据(有环境互动和负样本),但使用固定目标,而真正的路径需要"演化的目标(evolving objective)"。 [42:50-43:57] | 类型:观点 | 备注:Efros 认为 GAN 的判别器演化(对抗目标)有这种演化目标的味道;好奇心驱动的方法也是,但尚未完全成功;进化本身是这种"目标本身会演化"的最好例子。
内部张力与自我修正
-
[33:01-33:07] vs [42:50-43:09]:Efros 在总结时说"表层数据已经足以实现一些魔法",但后来在 Q&A 中对"AI 是否能从根本上创造"的问题说"这些模型每五分钟就在变化,我不关心证伪这件事"。这暴露了一个方法论上的诚实承认:他无法量化"表层数据天花板"在哪里,整个论点属于对未来的猜测,而非已证命题。他自己的例子(一张合成图像追溯到 6 张训练图)证明力有限,他承认听众的批评是合理的。
-
[20:22-20:29] vs [43:04-43:20]:Efros 声称机器人领域"没有希望",但随后在 Q&A 中同意 Alison Gopnik 的观点——RL 在 Chess、Go 等"足够小且约束明确的环境"中确实成功地挖掘了深层数据。他没有明确说明为什么他认为这种成功不能扩展到物理机器人,而只是诉诸规模和现实世界复杂性。
-
[38:45-39:00] vs [34:50-35:00]:Efros 批评遥操作"缺乏负样本、是被动数据",但他的好奇心-Mario 实验本身就是在模拟器中进行的,他也承认"在真实机器人上从未成功过"。他提倡的"婴儿科学家机器人"作为愿景(vision)存在,但尚无在真实世界中运行的证据。
大白话重讲
你有没有想过,为什么你能凭感觉知道那把刀很重,那杯液体是蜂蜜而不是水?不是因为你读了"蜂蜜的密度是水的 1.4 倍",而是因为你小时候真的把蜂蜜罐拿起来过,感受过那种拉丝感,可能还把它涂得到处都是。这是 Efros 在这场演讲里讲的核心问题:今天的 AI 没有经历过这些。
他从批评一个很著名的论断开始。2019 年,RL 之父 Rich Sutton 写了一篇"苦涩的教训":简单的通用方法加上计算规模比所有专业化方法都好。这篇文章被当作某种"承认人类智慧无用"的悲剧来解读。但 Efros 说,等等,这根本不苦——Darwin 发现进化论的时候,分类学家也没有"失去"什么,科学本来就是在寻找更简单的答案。而且"苦涩的教训"真正苦的方向搞反了:真正让人不舒服的发现是我们人类自己比我们想象的更简单,99% 的时候我们只是在模仿和拼贴。
然后他提出一个更根本的批评:Sutton 的文章里"计算"出现了 21 次,"数据"只出现 1 次。有人说计算可以替代数据——你只要有足够多的 GPU,就能从宇宙大爆炸开始模拟,最终模拟出我们的世界,根本不需要从现实中采集数据。但 Efros 说,这忽略了一件事:我们不是要模拟"任意一个可能的世界",我们要的是"这个"世界。而这个世界是什么样子,取决于几十亿年来无数次随机决策——恐龙死没死、某次突变有没有发生。这些随机决策构成了一个你无法推导的"熵向量",它就是我们世界的指纹。这个指纹,只能从数据里得到。计算能做的,只是"有足够的算力去触碰所有数据"。
接下来是演讲最核心的区分:表层数据和深层数据。表层数据是你坐着就能拿到的:文字、图像、视频。深层数据是你必须动手才能挖到的:那把刀有多重、那台 Mac 的盖子往哪个方向开、那杯东西的粘稠度。现在的 AI 训练的全是表层数据——爬 Common Crawl、刷 LAION 图像库、看 YouTube 视频。所以它们非常擅长一件事:插值(interpolation)。给你生成一张"从地面长出的绿色叶藤生物"的图?没问题,把 6 张最像的训练图拼在一起就行。但这不是创造,这是拼贴。
婴儿不一样。婴儿是深层数据矿工。他们把所有东西放进嘴里,是在主动挖掘味觉数据。你现在闭眼想象手机的味道——为什么你能想象?因为你小时候真的舔过它。这种数据,爬不到,只能亲身去挖。
这对机器人来说问题最严重。语言 AI 的表层数据起码数量庞大,最坏情况下"输出听起来像詹姆斯·乔伊斯的后现代主义"——乱,但没啥大事。机器人可不行:摔东西就是摔东西,物理世界会推回来。偏偏机器人领域的数据几乎为零,而且仅有的数据还是错的——遥操作是被动的,模拟器缺乏现实感,视频数据缺乏具身性。没有负样本,机器人不知道什么是"失败"。
出路是什么?Efros 在 2017 年和 Deepak Pathak 一起做过一个实验:能不能让 AI 在没有任何奖励的情况下学会玩 Mario?答案是可以。他们把好奇心定义为"预测误差"——AI 预测接下来会发生什么,如果预测错了,那就说明这个地方很有趣,值得继续探索。结果:Mario 学会了存活、前进、杀死敌人,不是为了得分,而是因为这些事"有趣"。这产生了一个飞轮:越探索,能力越强;能力越强,能获取的数据越好;数据越好,好奇心越有方向感。
他的愿景是"婴儿科学家机器人":一个没有任何固定任务的机器人,它的唯一目标就是挖掘更好的深层数据。这不是你说"去拿那个杯子"然后它去拿;这是你放它在世界里,它自己去探索、去失败、去发现。就像婴儿一样——你离开房间 13 毫秒,回来它已经打开了笔记本电脑,正在挖掘新一层数据。
值得精听的片段
-
[06:55-08:39] 不可约熵论证。Efros 用物理模拟的思想实验,论证为什么计算永远无法替代数据——因为我们要的不是"任意可能的世界",而是"这个世界的签名"。逻辑极其紧密,一气呵成,是整场演讲最有哲学深度的一段。
-
[22:01-24:29] 表层数据与深层数据的定义与例子。Efros 用"刀的重量"、"液体的粘稠度"、"Mac 的开盖方向",然后跳到"婴儿把一切放进嘴里",最后用"你想象手机的味道"这个思想实验,把一个抽象区分变得非常具体而令人信服。
-
[30:25-32:10] 好奇心 = 预测误差,以及 2017 年 Mario 实验。Efros 顺带披露他们的工作是"Yann 之前的世界模型(pre-JEPA)",在特征空间做预测,有逆模型。这段非常紧凑,信息密度高。
-
[42:01-44:14] Q&A:Alison Gopnik 关于 RL 与深层数据的关系分析。这段是整场最有密度的对话交锋——Gopnik 精确指出了"目标导向的 RL"和"探索性内在动机"的本质差异,以及后训练 RLHF 为什么只是"无聊的偏好反馈"。Efros 的回应和对 GAN 作为"演化目标"的怀念很有启发性。
-
[34:37-38:30] 两个小实验:无奖励学 Mario 和乒乓球"不是为了得分,而是为了保持对话"。这是好奇心驱动探索的最好的直觉演示,轻松但概念锋利。
与往期的呼应
- 同构→ 世界模型与真实世界智能 · Yann LeCun
两者共享同一核心洞察:在表示/特征空间做预测比在像素/token层面更有效。Efros 的2017好奇心论文正是「Yann 称之为世界模型之前的世界模型」,JEPA 是其系统化与命名。
本期[30:25-31:44] Efros 将2017年好奇心论文称为「pre-JEPA」——在特征空间做预测、同步训练逆模型学习特征表示,显式说这是「Yann 之前就存在的世界模型」。
往期[23:36-25:00] Yann LeCun 提出 JEPA(联合嵌入预测架构):不在像素空间而在表示空间做抽象预测,以过滤噪声并捕获物理规律——即 Efros 2017年工作的系统化后继。
- 印证→ 经验时代:超越人类数据的强化学习 · David Silver
Silver & Sutton 提出 AI 正从「人类数据时代」转向「经验时代」——智能体主动与环境交互产生经验来学习;这正是 Efros 的深层数据飞轮。Efros 在演讲末甚至直接说 Sutton 最新论文「提到数据18次,非常同意我们」。
本期[37:00-37:28] Efros 说 Rich Sutton 最新论文「非常同意我们,提到了数据18次」,并提出飞轮宣言:「不要问数据能为你的机器人做什么,要问你的机器人能为数据做什么」。
往期[The Era of Experience · 核心论断] 论文主张 AI 正从「人类数据时代」转向「经验时代」——智能体将通过与环境主动交互产生的经验进行持续学习,突破监督学习的人类数据瓶颈。
- 补充→ 人类数据与机器人学的GPT-3时刻 · Danfei Xu
Efros 诊断了机器人深层数据危机(数量为零、质量错误),但未给出采集路径;Danfei Xu 的 EgoMimic 工作正好填补这个缺口:以第一人称人类数据作为可规模化的具身深层数据来源。
本期[20:15-21:00] Efros 指出机器人数据「几乎为零」且「种类错误」——遥操作缺乏规模和负样本,物理世界的「推回」无法从被动数据中获得。
往期[01:23:53] Danfei Xu 指出第一人称人类视频(EgoMimic)在数据精确度与可规模化之间找到甜蜜点——让采集者佩戴 AR 眼镜主动生活即可采集具身交互数据,是机器人深层数据的当前最佳路径。
- 同构← 生物电、形态发生与两头涡虫 · Michael Levin
两人都在论证同一件反直觉的事:复杂、看似有目的的策略行为,可以在没有显式编程、没有奖励信号、甚至没有进化选择史的情况下直接「涌现」出来——它来自系统与约束环境的互动本身,而不是被写进代码或被训练出来的。Levin 用六行确定性的 bubble sort 代码举例:遇到锁死无法移动的故障数值时,算法会自发执行「先让数组更乱再排序」的延迟满足策略,这个策略不在代码里。Efros 用 2017 年与 Pathak 的无奖励 Mario 实验举例:把好奇心定义为预测误差后,AI 自发学会了存活、前进、杀敌——不是为了得分,只是因为这些事「有趣」。
本期[30:54]-
[31:06] Efros 与 Pathak 2017 年的无奖励 Mario 实验:好奇心被定义为预测误差,AI 在没有任何奖励的情况下学会了存活、前进、杀死敌人——驱动探索的内在动机产生了一个自然课程(natural curriculum)的飞轮,而不是由外部奖励或预设目标指定的。
- 同构← 工作记忆的神经种群动力学:记忆不是存储,是变形
Efros区分「表面数据」(被动统计关联)和「深度数据」(主动探索、因果结构、感觉-运动反馈的同步)。他认为AI系统需要深度数据才能发展出真正的世界模型。Li和Curtis的发现提供了「深度数据产生什么样的内部表征」的神经科学案例:在工作记忆任务中,人类V1的神经代码不只是存储了「目标在哪里」的静态模式(这是表面数据能做到的),而是在12秒延迟中把感觉输入主动转换为扫视计划(感觉→运动的格式转换)——这需要大脑知道自己在视觉场中的位置(中央凹位置)、知道任务目标(眼跳到目标),然后计算两者的关系。这种「我的位置 + 目标位置 + 行动计划」的整合,正是Efros所说的主动具身探索(embodied active exploration)产生的深度计算。被动观看条件证明了这一点:相同的感觉输入,没有行动意图,V1就不执行这种转换——计算由任务驱动,而不是由感觉输入驱动。
本期[Efros集核心论点] 「表面数据」是AI从互联网的被动观察中学到的统计关联——图像识别、语言理解。「深度数据」是机器人通过主动探索获得的感觉-运动关联数据:伸手触碰物体时,同时获得视觉(物体移动)、触觉(手的感觉)、运动(手的位置)的同步反馈。Efros认为这种主动具身数据是构建真正世界模型的必要条件。他的「好奇心驱动的机器人」正是在主动生成这种深度数据。Li和Curtis所描述的V1动态是人类大脑利用这种深度数据(通过漫长的发展历史,通过眼动经验和感觉-运动协调)建立起来的「扫视引导计算」能力的体现。
往期[论文对照实验,第9页] 「Notably, when visualizing the activation maps for V1 during the passive viewing experiment, we did not observe dynamics like those in the WM experiment. The response emerged at the target's polar and eccentricity at the early time points, and diminished in the middle of the delay.」[论文讨论,第12页] 「The early visual cortex seems to concurrently reflect the immediate task demand that requires observers to concurrently hold fixation and the memorized target at far eccentricity, leading to an activity with a peak at more foveal locations with a tail pointing toward the target.」
- 同构← 变换器注意力的执行控制缺陷:Stroop任务揭示LLM不能做什么
Efros区分了「表面数据」(AI当前学习的那种,基于统计关联)和「深度数据」(因果结构化的、主动探索获得的数据)。他认为AI需要深度数据才能发展出真正的「世界模型」,而不只是模式匹配器。Patel等人的发现是这个区分的实证体现:Claude 3.5在没有prompt的情况下「识别」了Stroop范式(表面模式匹配的极致表现——它认出了任务),但还是给出了错误答案(没有「深度数据」支撑的世界模型,无法在运行中主动压制干扰)。「知道任务 ≠ 能执行任务」的解离就是Efros所说的「表面模式识别」和「真正的因果理解」之间差距的一个具体、可测量的表现。更具体地:执行控制需要的不只是「我知道颜色和词义之间的关系」,而是「我在当前情境中的目标是什么,以及我主动维持这个目标而不被干扰信息偏离的能力」——这正是Efros所说的「好奇心驱动的主动探索」(而不是被动的统计关联学习)所产生的能力。
本期[Efros集核心论点] 「表面数据」:互联网上的文本/图像数据,AI从中学到了海量的统计关联。「深度数据」:需要主动与世界交互才能获得的因果数据——比如机器人伸手触碰物体时的触觉/视觉/运动反馈的同步。Efros说当前AI的「苦涩教训」(scaling laws, more data + more compute = better)正在逼近回报递减的上限,因为表面数据的量再多也补不了因果结构的缺口。这篇论文用Stroop任务量化了这个缺口的一个维度:给再多文本训练数据,也产生不了「在冲突中维持目标」的执行控制能力,因为这个能力来自神经网络里一个尚未实现的架构特性,不来自数据量。
往期[论文第18-19页] 「In our exploratory trials without explicit prompts, Claude 3.5 Sonnet demonstrated recognition of the Stroop paradigm but still produced incorrect responses despite output with word-color relationship mappings. This behavior demonstrates a dissociation between task understanding and execution capabilities. The models' effective context window for executive control is notably shorter than their general processing capacity.」[论文第16页] 「The inability to resolve cognitive conflicts in the color naming task due to limited executive control appears to be the primary hindering factor in model performance.」
- 补充← 教 AI 的人与知识工作的未来 · Brendan Foody
Foody 区分「输出数据」(表层)和「评估数据」(深层)——后者让模型能反复尝试、打分、改进——这和 Efros 对「表层数据」(被动收集)vs「深层数据」(主动具身采集)的区分在结构上高度一致。两者都指向同一个结论:能衡量成功的反馈数据比纯内容数据更有价值。
本期[20:15-21:00] Efros 说深层数据的关键是「物理世界的推回(pushback)」——当你对物体做错了,世界会告诉你;被动收集的表层数据缺乏这种反馈,因此无法训练真正的具身能力。
往期[13:42-15:13] Foody 说评估数据(rubric、测试题、标准答案)远比输出数据(模型读的内容)宝贵,因为它让模型能「无限次尝试、不断打分、不断学习」——即形成真正的强化信号。
- 互引← 儿童如何学习,AI 是什么文化技术 · Alison Gopnik
Gopnik 的「文化技术」框架被 Efros 直接引用并作为其「表层数据 vs 深层数据」论点的核心参照——两者对当前 AI 的诊断高度一致(缺乏主动具身实验),且他们出席了同一个工作坊,Gopnik 在 Efros 讲座的 Q&A 中直接发言。
本期[24:09-24:29] Efros 在工作坊演讲中说「我非常喜欢 Alison 谈论当前 AI 的方式。她说,这些当前的 AI 不是智能体,它们是文化技术」——直接援引 Gopnik 的框架作为自己「表层数据」论点的哲学基础。
往期[45:05-47:00] Gopnik 阐述「文化技术」论:AI = 印刷术/图书馆/互联网搜索,是人类获取彼此知识的工具;它做不到两岁儿童能做的事——主动与物理世界互动、做实验、得到具身反馈。
这是以原文为依据的一次解读,不能替代原文。每条要点都标注了出处,欢迎回到原文核对——也欢迎指出任何细微的偏差。