
transcript
show notes
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
Generative Skill Composition for LLM Agents
Summary
近期的大语言模型 Agent(LLM agents)得益于技能(Skills)来解决复杂任务。技能封装了执行特定任务(例如搭建沙箱环境、运行测试套件或跨多个文件重构函数)的模块化程序性知识与指令包。随着技能库不断扩大并在不同任务和领域间得以复用,选择合适的技能组合(skill composition)已成为核心瓶颈。
现有方法主要分为两类:一类是将 Agent 的推理完全暴露给整个技能集;另一类是通过嵌入向量(embeddings)或基于 LLM 的重排序器(rerankers)来进行技能检索。这两类方法虽然都提供了有价值的见解,但它们忽略了技能组合的结构化特性——这是一种关于“选用哪些技能、使用多少个以及以何种顺序执行”的联合决策,而这三个维度是无法解耦的。
我们将此形式化为结构化技能组合(structured skill composition):给定一项任务和一个技能库,预测出一个可执行的技能计划,该计划联合指定了激活的子集、数量和执行顺序。
我们提出了 SkillComposer,它将结构化技能组合实例化为基于任务条件的技能序列预测。SkillComposer 在技能标识符(skill identifiers)上使用受约束的自回归解码器,从而使子集、数量和顺序在单次解码过程中共同产生,并且顺次发生的技能之间的依赖关系能够被自然地捕获。
我们从真实的人工整理技能库中构建了一个“任务-组合”对的训练集。随后,我们从两个维度对 SkillComposer 进行了评估:留出测试集上的组合质量,以及在 SkillsBench 上跨两个生产级编程 Agent 的下游任务成功率。在 GPT-5.2-Codex 和 Gemini-3-Pro-Preview 上,SkillComposer 相较于无技能基线(no-skill baseline)将通过率分别提升了 +23.1 和 +18.2 个百分点,不仅超越了 Top-3 检索,还在更低的 Prompt Token 成本下达到了黄金技能检索(gold-skill retrieval)的性能上限。
原文链接:https://arxiv.org/abs/2606.32025
前往小宇宙评论区与主播互动






