
transcript
show notes
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and Compose
Summary
LLM Agent 越来越依赖外部技能(即包含重用工具规范的定义),但现实世界中的任务通常需要组合多个技能,而不仅仅是选择单个技能。我们将该问题形式化为组合式技能路由(Compositional Skill Routing)问题:给定一个复杂的用户查询和一个庞大的技能库,将查询拆解为原子子任务,为每个子任务检索合适的技能,并构建出一个可执行的规划。
我们提出了 SkillWeaver,这是一个结合了 LLM 任务分解器、带 FAISS 索引的双编码器(bi-encoder)技能检索器以及依赖感知 DAG 规划器的“拆解-检索-组合”框架。为了支持评估,我们推出了 CompSkillBench,这是一个包含 300 个组合式查询的基准测试,涵盖来自公开 MCP 生态系统、跨越 24 个功能类别的 2,209 个真实 MCP 服务端技能。
我们的实验表明,任务分解的质量是主要瓶颈:标准 LLM 分解在步骤层面的类别召回率(category recall)仅达到 34.2%。为了解决这个问题,我们提出了迭代式技能感知分解(Iterative Skill-Aware Decomposition,简称 SAD),这是一种检索增强的反馈循环,能够迭代地将分解过程与可用技能进行对齐。SAD 在单次迭代中将分解准确率从 51.0% 提升至 67.7%(相对提升 +32.7%,Wilcoxon 检验 p<10−6);基于分解准确性(DA)的条件分析证实,正确的粒度是实现有效检索的前提条件(当 DA=1 时,CatR@1 从 34% 上升至 41%)。
SkillWeaver 将上下文窗口的消耗降低了 99% 以上,迁移实验也证实了其泛化能力(即使检索池中缺失目标类别,相对 DA 收益仍达到了 +35.6%)。
原文链接:https://arxiv.org/abs/2606.18051
前往小宇宙评论区与主播互动






