English

教 AI 的人与知识工作的未来 · Brendan Foody

2026-06-14 · 由 PodLens 生成的忠实解读

原节目:https://youtu.be/zld39xD4sus?si=WrrsvImuMSX5fv4G · 时间戳可点击,就地跳转播放器

AI训练知识工作评估体系劳动力市场强化学习

这期讲了什么

这是 Tyler Cowen 的"Conversations with Tyler"播客,嘉宾 Brendan Foody 是 Mercor 的 CEO 和联合创始人(2023年初创立),当时22岁,据说是有史以来最年轻的独角兽创始人。Mercor 做的事是雇用专家来教 AI 模型:当 OpenAI 想让模型学习写诗,Mercor 找来最顶尖的诗人;想提升法律能力,找来 Cass Sunstein 和 Larry Summers 帮助设计评估体系(APEX)。经济逻辑非常清楚:一个专家的知识"做一次、用于数十亿用户",因此支付每小时150美元找诗人是合理的。

这次对话覆盖三个核心主题:

第一:AI 模型能力的真实现状。Foody 团队开发了 APEX(AI 生产力指数),测量模型在有经济价值任务上的表现(不是学术基准)。GPT-5 在这个指标上达到64%的人类专家水平,一年前的 GPT-4o 大约是40%左右;每年约25-30%的改进。Tyler 和 Foody 在两个问题上有分歧:(1) 多快 AI 会让 Cass Sunstein 无法找到错误(Tyler:6个月;Foody:2-3年);(2) 模型目前的核心限制是什么(长时任务 + 多工具整合,预计6-12个月改善)。

第二:两种数据类型与知识经济的结构性变革。Foody 区分了"输出数据"(模型能读并学习的内容)和"评估数据"(衡量成功的测试、标准答案、评分规则)——后者远比前者宝贵,因为它能让模型"尝试很多次、不断打分、不断改进"。他的核心预言:知识工作将重构为"构建 RL 环境"——投行分析师将不再重复分析数据室,而是教会智能体一次如何做,然后无限次使用。

第三:品味的难题与 Kantian 悖论。Tyler 援引康德《判断力批判》:品味(taste)就是那种无法被纳入评分标准的东西。如果 Mercor 需要的数据是评分标准,而品味根本无法被标准化,那 Foody 是在追求一个逻辑循环?Foody 的回应是 RLHF(偏好学习)——不一定要明确的标准,而是让有品味的人反复选择哪个更好,让模型从偏好中学习。这个哲学张力贯穿整个对话。

时间线主题地图

核心观点清单

  1. Mercor 的经济学:专家的知识做一次,用于数十亿用户。这解释了为什么给诗人每小时150美元是合理的——一个顶级诗人建立的评分标准可以训练被数十亿人使用的模型。"我们能支付这么高的价格,是因为这些知识被重复使用了这么多次。" [01:35-02:45] | 类型:商业逻辑

  2. 两种数据类型:输出数据(内容)vs 评估数据(测量成功的标准、测试、答案)。评估数据远比输出数据宝贵,因为它能让模型"无限次尝试、不断打分、不断改进"。学术期刊同行评审报告 = 天然的高质量评估数据,Foody 认为学术机构应该把这些数据送给 AI 实验室(但目前还没有发生)。[13:42-15:13] | 类型:框架

  3. APEX 发现:模型在经济价值任务上每年改进约25-30%;GPT-5 达到64%的人类专家水平。但当前两个主要限制:(1) 长时任务(50-100小时工作,模型仍然做不到);(2) 多工具整合。两者都预计在6-12个月内有重大突破。[05:41-09:25] | 类型:实证数据 | 备注:Tyler 认为 Foody 低估了进展速度,Tyler 预测 Cass Sunstein 在6个月内无法找到模型错误;Foody 说2-3年。

  4. 康德的品味难题(Foody 没有完全解决的核心张力):康德在《判断力批判》中说,品味(taste)就是那种无法被捕入标准/规则(rule)的东西。Mercor 需要的数据是标准,但品味是 AI 领域最关键的缺失。Foody 的应对是 RLHF(偏好比较),但这并没有从根本上解决问题——品味偏好数据和品味本身之间的距离依然存在。[17:58-18:40] | 类型:哲学张力

  5. 知识经济将重构为"构建 RL 环境":投行分析师将不再重复分析数据室,而是教会智能体一次如何分析,然后无限次使用;客服人员将不再重复回答工单,而是找到智能体犯的错误,把它变成 RL 环境,让智能体从错误中学习。5年内,大部分高端知识工作者将成为"模型训练者"(全职或通过平台兼职)。[23:04-30:39] | 类型:预测

  6. 需求价格弹性决定 AI 对不同行业的影响:软件工程高度弹性(10倍效率可能带来10倍数量的工程师);会计和客服可能弹性低;教育居中(Sal Khan 私教效应非常好,但每天只有那么多小时)。[31:36-36:32] | 类型:分析框架 | 备注:这是最实用的判断框架之一——不问"会不会被替代",而问"需求是否随供给增加而增加"。

  7. AI 辅助面试的正确应对:不是禁止使用工具,而是测试他们使用工具能做什么。"要求在纸上写作是错误的;正确的做法是给他们所有 AI 工具、录屏,看1小时内能构建什么。这是对实际能力的更好预测。" [44:08-44:34] | 类型:实践建议 | 备注:这个框架对于所有需要评估人类在 AI 时代价值的场合都适用。

  8. 阅读障碍与创业成功的正相关(shockingly strong)。可能机制:早期学会向他人委托任务、习惯大局思考而非细节执行、适应多种认知策略的能力。Tyler 的假说:强迫早期学会委托,是所有聪明人中最难习得的技能之一。[54:13-56:14] | 类型:观察 | 备注:Foody 本人是阅读障碍者,联合创始人是全国最强的辩论队,两者互补。

内部张力与自我修正

大白话重讲

Brendan Foody 在22岁创立了 Mercor,做的事你可以用一句话总结:他是给 AI 模型找老师的人。当 OpenAI 想让 GPT 学会写更好的诗,他找来顶尖诗人;当想让模型更懂法律,他找来 Cass Sunstein;当想让模型更懂金融,他找来 Larry Summers。这些专家的工作是制定评分标准、创建测试用例,让模型能够反复练习、打分、改进。

为什么给诗人每小时150美元?因为那个诗人建立的知识和标准,会被用来训练一个被数十亿用户使用的模型。这个知识只需要做一次,就可以无限次使用——所以单次成本分摊到全部用户身上,非常合算。

Foody 的团队做了一个叫 APEX 的测量工具,专门测模型在"有经济价值的任务"上有多厉害——不是测数学竞赛题、博士级别的知识,而是测"模型能帮麦肯锡顾问完成多少他们日常工作中的任务"。测量方法也很巧妙:先调查这些顾问如何分配时间,然后用时间比例作为经济价值的代理指标。结果显示,GPT-5 大概能完成人类专家64%的经济价值任务,而一年前的模型大约是40%多——每年约25-30%的改进。

在这场对话里,Tyler 和 Foody 有几个有趣的分歧。Tyler 认为,6个月内就会到达模型无法被顶尖法学家找到错误的阶段;Foody 说2-3年。Tyler 觉得 AI 已经在很多方面超越了人类专家;Foody 说最后25%的能力——那些依靠未被文字编码的隐性知识和品味——会很长时间内仍然需要人类。

最有意思的一段是 Tyler 搬出了康德。康德在《判断力批判》里说,品味(taste)的定义就是"无法被纳入任何规则或标准的判断"。Foody 说他需要的数据是评分标准(rubric)。那如果品味根本不能被标准化,你要的数据从哪里来?Foody 用 RLHF 回应:不一定要显式的标准,让有品味的人反复比较两个输出选哪个更好,模型从这些偏好中学习。但这并没有完全回答问题——因为普通用户在研究中更喜欢 AI 写的诗,而顶尖诗人认为人类写的更好。你到底优化谁的偏好?

Foody 对知识工作未来的预测是:大部分人不会被 AI 替代,而是会变成"模型训练者"。投行分析师现在每隔几周就要从头分析一个新的数据室,未来他们会教模型一次如何做这件事,然后专注于发现模型犯的错误、把这些错误变成新的训练数据。这个过渡用 Foody 的话说,"就像建软件:固定成本投入,无限次使用。"他预测5年内大多数高端知识工作者会在做这件事。

值得精听的片段

与往期的呼应

本页为对节目内容的忠实解读与大白话重述,由 PodLens 生成。

这是以原文为依据的一次解读,不能替代原文。每条要点都标注了出处,欢迎回到原文核对——也欢迎指出任何细微的偏差。