English

SkillComposer:大语言模型推理期 Agent 技能自适应演化 · Qi Zhang

2026-06-21 · 由 PodLens 生成的忠实解读

原文:https://arxiv.org/abs/2606.06079

Agent 技能推理期演化拒绝采样泛化与特异性认知基础设施编译型过滤器

这篇论文讲了什么

这篇论文探讨了如何让大语言模型(LLM)驱动的智能体在推理期自主构建、优化和提炼可重用的“Agent 技能 (Agent Skills)” [Abstract]。传统的技能抽取方法通常采用“单次抽取 (one-shot extraction)”,这带来了一个根本性的张力:如果技能写得太具体,就很难迁移到其他任务上;如果技能写得太抽象,又无法对具体任务提供足够的指导 [§1]。

为打破这一瓶颈,作者提出了 SkillComposer 框架,将技能构建解构成三个可学习的元操作:Skill Create(从成功轨迹中提取原始技能)、Skill Merge(将相似技能合并,推动“泛化”)和 Skill Improve(根据新任务的反馈迭代优化,推动“特异化”) [§3.2]。SkillComposer 提出了一种基于“Delta 成功率 (delta pass rate)”引导的拒绝采样框架,用来训练大模型自身掌握这种技能演化能力 [§3.4]。该框架支持三种部署模式:离线模式(构建通用技能库)、在线模式(任务级实时优化)和混合模式(离线冷启动 + 在线特异化) [§3.3]。在 τ2-Bench(智能体交互)、LiveCodeBench v6(代码生成)和 AppWorld(未见过的 API 调用)三个基准上的实验表明,SkillComposer 显著提升了模型的任务解决率与 Token 使用效率 [§4], [§5]。

论文骨架

核心论点清单

  1. 技能的“泛化度(Generalization)”与“特异度(Specification)”是相互拮抗的两个质量维度。 如果不进行干预,大模型直接生成的技能会走向两个极端:要么极度狭隘地复述原任务示例(不可迁移),要么过度抽象流于泛泛而谈(无法指导行动)。
    • §1 Introduction, p.2: "Effective skills require both generalization... and specification... yet existing methods provide no systematic way to achieve either."
    • 观点
  2. 通过“Delta 成功率(Delta Pass Rate)”过滤生成的技能,是实现技能质量控制的关键过滤器。 只有当大模型编写的技能在注入上下文后,执行器(Executor)的成功率比 vanilla 基线有显著提升(例如提升超过阈值 $\epsilon$),该生成样本才被认为有效并被接纳进 SFT 训练集。
    • §3.4, p.4-5: Equations (2)-(4)
    • 事实
  3. 在离线技能库构建中,一味引入“Skill Improve”特异化优化反而会损害库的泛化性能。 离线库的目标是保持跨任务的广泛覆盖率,此时引入过度特异化的 Improve 会使库中的技能与特定任务深度绑定,从而抵消了 Skill Merge 带来的去冗余和通用性收益。
    • §5.1, p.8-9: Table 2 (Create/Merge 表现好于 Create/Merge/Improve)
    • 事实
  4. 技能组合能力(Skill Composition)是一种可以跨越任务类型(如从 Agent 任务向 Code 任务)迁移的元能力(Meta-Ability)。 只在 Agent 任务(Tau2Bench 交互)上训练的 4B 模型,即便从未见过代码,其生成的 Merge 和 Improve 技能依然能大幅提升 27B 执行器在 LiveCodeBench 上的代码表现。
    • §5.2, p.10: Table 3 ("Agent-only training still improves code performance...")
    • 观点
  5. 在推理预算相同的情况下,迭代演化技能比暴力多次采样(Vanilla Pass@k)表现出更强健的边际增益。 暴力多次采样只是重复概率尝试,而 SkillComposer 的 Online 模式(利用上一次失败/成功轨迹迭代改写技能)能使成功率曲线呈陡峭上升趋势,且二者差距随着迭代次数增加而持续拉大。
    • §5.4, p.11: Figure 4
    • 事实

大白话重讲

在现在的 AI 开发中,有一个非常前沿的思路:让大模型在做任务之前,先去阅读一篇写有攻略的“技能文档 (SKILL.md)”。读完攻略后,AI 的通关率会大幅提升 [Introduction]。但这带来了一个让人头疼的问题:攻略如果写得太宽泛(比如“遇到问题要冷静”),AI 读完还是不会操作;但如果攻略写得太细碎(比如具体到“第一步点按第 3 行第 2 个像素点”),只要稍微换个新任务,这篇攻略就成了废纸 [Introduction]。

SkillComposer 的核心目的,就是让大模型自己学会撰写、合并以及修改这些“技能攻略”,并在“太泛”和“太窄”之间找到完美平衡 [§1]。

它把写攻略这件事拆成了三步 [§3.2]: 1. Skill Create(写初稿):AI 成功完成一次任务后,顺手把自己的通关路径写成一篇攻略; 2. Skill Merge(合并去重):AI 发现档案库里积攒了太多类似的攻略(比如一千篇关于如何注册账号的攻略),于是把它们归纳合并成一篇通用攻略,让档案库变得精简 [§3.2, Equation 1]; 3. Skill Improve(迭代修正):当 AI 拿着通用攻略去挑战一个新游戏时,发现有些细节不对劲,于是根据这次的新经验,给攻略打个升级补丁,让它更完美地契合当前任务 [§3.2]。

为了训练大模型写出真正高质量的攻略,SkillComposer 发明了“Delta 成功率体检机制” [§3.4]。AI 写出的攻略好不好,不需要人工去判分,而是直接扔给另一个 AI 拿着这篇攻略去通关 5 次。如果通关成功率比“没读攻略”时提升了 40% 以上,就证明这篇攻略是干货,立刻录入训练集;如果读完没效果甚至帮了倒忙,就直接当成垃圾扔掉 [§3.4]。

这种写攻略的能力是高度通用的。作者做了一个神奇的实验:只教大模型怎么写“客服聊天”的攻略,从来没教过它写“写代码”的攻略。但这个大模型却能无师自通地帮写代码的 AI 总结出了非常优秀的“编程Debug攻略”,让写代码的 AI 成功率大幅提升 [§5.2]!这说明,总结和提炼攻略是一种“元能力”,一旦学会,终身受用。

术语小词典

这篇之前与之后

之前 (Preceding Works)

之后 (Succeeding/Concurrent Works)

最值得读原文的几段

与往期的呼应

本页为对论文内容的忠实解读与大白话重述,由 PodLens 生成。

这是以原文为依据的一次解读,不能替代原文。每条要点都标注了出处,欢迎回到原文核对——也欢迎指出任何细微的偏差。