Skip to content
Artwork for Seventy3
Seventy3 · August 15 · 24 min

【第685期】Agent-as-a-Router:编程任务的智能模型路由框架

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Agent-as-a-Router: Agentic Model Routing for Coding Tasks Summary 在现实场景中,用户通常可以接入来自不同供应商的多个大语言模型(LLM),且这些 LLM 往往在不同的领域各有所长,但没有单个模型能够独霸所有领域。因此,将每个任务路由至最合适的模型,对于提升性能和控制成本均至关重要。 现有的路由器将该问题视为一种静态的、一次性的分类问题。然而,我们发现这些路由器的性能瓶颈在于信息匮乏:仅仅为原生 LLM 路由器补充任务维度层面的性能统计数据,就能带来 15.3% 的相对收益,超越基于同等维度先验构建的启发式路由方式。 受此发现启发,我们提出了 Agent-as-a-Router 框架,将路由过程形式化为一个 C-A-F 循环(上下文 Context →行动 Action → 反馈 Feedback → 上下文 Context)。该框架通过在部署期间不断积累基于执行实践的经验,填补了信息鸿沟。 我们将该框架实例化为 ACRouter(由协调器 Orchestrator、验证器 Verifier 和记忆模块 Memory 组成),并推出了 CodeRouterBench 评估环境——该环境包含约 1 万个任务实例,并附带来自 8 个前沿 LLM 的验证得分,从而支持在流式任务上进行基于“后悔值”(regret-based)的路由器对比。 实验表明,ACRouter 在域内(in-distribution)任务上取得了最低的累计后悔值,并且能够泛化至域外的具主体性编程(agentic-programming)任务,证明了我们的路由框架能够主动弥合信息差。 原文链接:https://arxiv.org/abs/2606.22902 前往小宇宙评论区与主播互动

0:00-24:49

transcript

No transcript — this publisher did not publish one.

show notes

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

今天的这篇的主题是:

Agent-as-a-Router: Agentic Model Routing for Coding Tasks

Summary

在现实场景中,用户通常可以接入来自不同供应商的多个大语言模型(LLM),且这些 LLM 往往在不同的领域各有所长,但没有单个模型能够独霸所有领域。因此,将每个任务路由至最合适的模型,对于提升性能和控制成本均至关重要。

现有的路由器将该问题视为一种静态的、一次性的分类问题。然而,我们发现这些路由器的性能瓶颈在于信息匮乏:仅仅为原生 LLM 路由器补充任务维度层面的性能统计数据,就能带来 15.3% 的相对收益,超越基于同等维度先验构建的启发式路由方式。

受此发现启发,我们提出了 Agent-as-a-Router 框架,将路由过程形式化为一个 C-A-F 循环(上下文 Context →行动 Action → 反馈 Feedback → 上下文 Context)。该框架通过在部署期间不断积累基于执行实践的经验,填补了信息鸿沟。

我们将该框架实例化为 ACRouter(由协调器 Orchestrator、验证器 Verifier 和记忆模块 Memory 组成),并推出了 CodeRouterBench 评估环境——该环境包含约 1 万个任务实例,并附带来自 8 个前沿 LLM 的验证得分,从而支持在流式任务上进行基于“后悔值”(regret-based)的路由器对比。

实验表明,ACRouter 在域内(in-distribution)任务上取得了最低的累计后悔值,并且能够泛化至域外的具主体性编程(agentic-programming)任务,证明了我们的路由框架能够主动弥合信息差。

原文链接:https://arxiv.org/abs/2606.22902


前往小宇宙评论区与主播互动
links2