English

表层数据与深层数据 · Alexei Efros

2026-06-14 · 由 PodLens 生成的忠实解读

原节目:https://www.youtube.com/live/vk6lgHjjGp8?si=5F0NXJlFZ_LtNfgm · 时间戳可点击,就地跳转播放器

具身智能好奇心驱动深层数据机器人世界模型

这期讲了什么

这是 UC Berkeley 计算机视觉教授 Alexei Efros(Alyosha)在一场学术研讨会上的演讲,他是 Shiri 的博士导师,与 Alison Gopnik、Jitendra Malik、Phil Isola 等人同处一个多日工作坊。演讲的核心问题非常直接:Rich Sutton 2019 年的"苦涩的教训"究竟苦在哪里?计算(Compute)真的能替代数据(Data)吗?Efros 的答案是:这堂课根本不苦,而且方向搞错了。

Efros 的核心论题是数据先于计算。他借用一个物理学直觉切入:我们想建模的不是"任意一个可能世界",而是这个世界——这个特定的、从大爆炸经由恐龙灭绝一路到今天的世界。这个世界之所以是它自己,靠的是一串不可还原的"硬币翻转"(coin flips)——那些随机性决策构成的熵向量,是宇宙对我们世界的签名。无论你有多少 GPU 从第一性原理模拟,都无法从计算中生成这个向量;它只存在于数据里。因此,数据不是计算可以替代的资源,而是不可约的基础。

但光有数据还不够,还要看什么类型的数据。演讲的第二个核心区分是表层数据(Surface Data)与深层数据(Deep Data):表层数据是被动刮取的,是文本、像素、音频信号,是你坐着就能拿到的;深层数据是需要主动挖掘的,是那把刀的重量、那杯液体的粘稠度、那台 Mac 的开盖方向——只有通过亲身互动才能获得的数据。婴儿是深层数据矿工的原型:他们把每样东西都放进嘴里,就是在主动采集味觉数据。而当前 AI(包括大语言模型、图像扩散模型)本质上都在刮表层数据,这是它们能做到魔法级别的插值和模仿,却无法真正外推的根本原因。

演讲的第三层是出路:好奇心驱动的具身探索。Efros 和 Deepak Pathak 在 2017 年做过一个无奖励学习 Mario 的工作,把好奇心定义为预测误差——预测不准的地方就是值得探索的地方。这产生了一个飞轮:数据→能力→更好的数据。他的愿景是"婴儿科学家机器人"(Robot Scientist in the Crib):目标不是完成任何任务,而是专职挖掘深层数据。他认为这是走向真正 AI 的必经之路。

时间线主题地图

核心观点清单

  1. 苦涩的教训并不苦——简洁性是科学的目标,达尔文和牛顿都是在"更简单",不是在"失去"。 [01:04-02:50] | 类型:观点 | 备注:Efros 认为真正苦涩的是对人类自身的重新定位:我们比我们以为的更简单,更像是随机拼贴机器。

  2. 不可约熵论证:我们的世界之所以是它自己,是因为一串无法从第一性原理推导的随机决策向量,这只能从数据中注入,无法用计算生成。 [06:55-08:39] | 类型:论证 | 备注:这是对"数据与计算可互换"论点的哲学级别反驳;Efros 明确说计算机图形学 25 年前犯了同样的错误——以为知道了所有物理就能渲染一切,结果因为缺乏数据的熵注入而失败。

  3. 计算是次要资源:你需要 O(N) 计算来"触碰"所有数据,但没有数据的计算是完全无用的。 [09:05-09:38] | 类型:观点 | 备注:这是数据优先论的操作性定义——计算是服务于数据的工具,不是可以替代数据的等价物。

  4. 现代扩散模型本质上是高维空间中的纹理合成,在像素 patch 层面做最近邻搜索并拼合,并非生成真正的新内容。 [12:12-12:45] | 类型:事实 | 备注:引用了 Surya 的理论论文——扩散模型等同于纹理合成;Neural Thickets 进一步论证预训练阶段已注入全部知识,后训练只是"告诉模型考的是哪门课"。

  5. 表层数据与深层数据的本质区分:表层数据是被动接收的信息(文本、像素、音频);深层数据是需要主动挖掘、通过具身互动才能获得的信息(重量、粘稠度、触感、物理因果)。 [22:01-25:10] | 类型:区分/框架 | 备注:婴儿通过把一切放进嘴里来采集味觉深层数据——"你小时候也把这房间里的所有东西放进嘴里过";Socrates 对书本的批评与此同构:"你为学生提供的是智慧的外表,而非实质。"

  6. 机器人领域存在双重数据危机:数量为零,且现有数据种类错误(被动遥操作,无负样本,无具身推回)。 [20:15-21:32] | 类型:事实 | 备注:与语言不同,物理世界会推回:语言的最坏情况是"听起来像詹姆斯·乔伊斯";但机器人摔东西就是损失。

  7. 好奇心 = 预测误差:驱动具身探索的内在动机可以定义为"我无法预测的事物",这产生自然课程(natural curriculum)和终身学习的飞轮。 [30:54-31:06] | 类型:框架 | 备注:2017 年与 Pathak 的合作——无奖励 Mario 学习。Efros 明确说这是"Yann 之前就存在的世界模型(pre-JEPA)",在特征空间中做预测并同时学习特征表示。

  8. 深层数据飞轮:数据→能力→获取更好数据的能力→更好的数据,并具备自然难度递增的课程。 [26:01-26:21] | 类型:框架 | 备注:现有机器人训练路径(遥操作、模拟、视频学习)都在飞轮之外——遥操作缺乏规模和负样本,模拟缺乏现实性且面临"同样的熵注入问题",视频学习缺乏具身性。

  9. RL 处于深层数据挖掘的"一半"位置:它确实在挖掘深层数据(有环境互动和负样本),但使用固定目标,而真正的路径需要"演化的目标(evolving objective)"。 [42:50-43:57] | 类型:观点 | 备注:Efros 认为 GAN 的判别器演化(对抗目标)有这种演化目标的味道;好奇心驱动的方法也是,但尚未完全成功;进化本身是这种"目标本身会演化"的最好例子。

内部张力与自我修正

大白话重讲

你有没有想过,为什么你能凭感觉知道那把刀很重,那杯液体是蜂蜜而不是水?不是因为你读了"蜂蜜的密度是水的 1.4 倍",而是因为你小时候真的把蜂蜜罐拿起来过,感受过那种拉丝感,可能还把它涂得到处都是。这是 Efros 在这场演讲里讲的核心问题:今天的 AI 没有经历过这些。

他从批评一个很著名的论断开始。2019 年,RL 之父 Rich Sutton 写了一篇"苦涩的教训":简单的通用方法加上计算规模比所有专业化方法都好。这篇文章被当作某种"承认人类智慧无用"的悲剧来解读。但 Efros 说,等等,这根本不苦——Darwin 发现进化论的时候,分类学家也没有"失去"什么,科学本来就是在寻找更简单的答案。而且"苦涩的教训"真正苦的方向搞反了:真正让人不舒服的发现是我们人类自己比我们想象的更简单,99% 的时候我们只是在模仿和拼贴。

然后他提出一个更根本的批评:Sutton 的文章里"计算"出现了 21 次,"数据"只出现 1 次。有人说计算可以替代数据——你只要有足够多的 GPU,就能从宇宙大爆炸开始模拟,最终模拟出我们的世界,根本不需要从现实中采集数据。但 Efros 说,这忽略了一件事:我们不是要模拟"任意一个可能的世界",我们要的是"这个"世界。而这个世界是什么样子,取决于几十亿年来无数次随机决策——恐龙死没死、某次突变有没有发生。这些随机决策构成了一个你无法推导的"熵向量",它就是我们世界的指纹。这个指纹,只能从数据里得到。计算能做的,只是"有足够的算力去触碰所有数据"。

接下来是演讲最核心的区分:表层数据深层数据。表层数据是你坐着就能拿到的:文字、图像、视频。深层数据是你必须动手才能挖到的:那把刀有多重、那台 Mac 的盖子往哪个方向开、那杯东西的粘稠度。现在的 AI 训练的全是表层数据——爬 Common Crawl、刷 LAION 图像库、看 YouTube 视频。所以它们非常擅长一件事:插值(interpolation)。给你生成一张"从地面长出的绿色叶藤生物"的图?没问题,把 6 张最像的训练图拼在一起就行。但这不是创造,这是拼贴。

婴儿不一样。婴儿是深层数据矿工。他们把所有东西放进嘴里,是在主动挖掘味觉数据。你现在闭眼想象手机的味道——为什么你能想象?因为你小时候真的舔过它。这种数据,爬不到,只能亲身去挖。

这对机器人来说问题最严重。语言 AI 的表层数据起码数量庞大,最坏情况下"输出听起来像詹姆斯·乔伊斯的后现代主义"——乱,但没啥大事。机器人可不行:摔东西就是摔东西,物理世界会推回来。偏偏机器人领域的数据几乎为零,而且仅有的数据还是错的——遥操作是被动的,模拟器缺乏现实感,视频数据缺乏具身性。没有负样本,机器人不知道什么是"失败"。

出路是什么?Efros 在 2017 年和 Deepak Pathak 一起做过一个实验:能不能让 AI 在没有任何奖励的情况下学会玩 Mario?答案是可以。他们把好奇心定义为"预测误差"——AI 预测接下来会发生什么,如果预测错了,那就说明这个地方很有趣,值得继续探索。结果:Mario 学会了存活、前进、杀死敌人,不是为了得分,而是因为这些事"有趣"。这产生了一个飞轮:越探索,能力越强;能力越强,能获取的数据越好;数据越好,好奇心越有方向感。

他的愿景是"婴儿科学家机器人":一个没有任何固定任务的机器人,它的唯一目标就是挖掘更好的深层数据。这不是你说"去拿那个杯子"然后它去拿;这是你放它在世界里,它自己去探索、去失败、去发现。就像婴儿一样——你离开房间 13 毫秒,回来它已经打开了笔记本电脑,正在挖掘新一层数据。

值得精听的片段

与往期的呼应

本页为对节目内容的忠实解读与大白话重述,由 PodLens 生成。

这是以原文为依据的一次解读,不能替代原文。每条要点都标注了出处,欢迎回到原文核对——也欢迎指出任何细微的偏差。