Skip to content
Artwork for Seventy3
Seventy3 · Friday · 21 min

【第712期】失败的演进:CLI编程智能体执行轨迹剖析

今天的这篇的主题是:Failure as a Process: An Anatomy of CLI Coding Agent Trajectories Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 大语言模型(LLM)编码 Agent(Coding agents)正越来越多地被部署于终端环境中自动执行软件工程任务,这使得它们的可靠性成为一个日益受关注的问题。现有的实证研究虽然探讨了编码 Agent 发生失败的原因,但大多将“失败”视为一种最终结果而非一个时序过程,对于失败如何萌生、演化并最终变得不可逆转所提供的见解非常有限。 本文展示了首个关于命令行(CLI)编码 Agent 失败轨迹的大规模实证研究,提出了一个面向过程的框架(process-oriented framework),通过执行轨迹中的萌生(onset)、演化(evolution)和恢复(recovery)三个阶段来分析失败。 我们首先收集了由 7 个前沿模型在 3 个编码 Agent 支架(OpenHands、MiniSWE 和 Terminus2)上于 Terminal-Bench 产生的 3,843 条执行轨迹;随后对其进行细致筛选,提取出 1,794 条完整且有效的轨迹用于人工标注(包含超过 63,000 个执行步骤);并从中推导出了涵盖失败发生率、根本原因、恢复机制以及跨系统一致性等方面的 14 项研究发现。 我们的研究结果表明: 编码 Agent 的失败主要是由认知错误(epistemic errors)驱动的; 失败通常在最初的几个执行步骤内就已开始萌生; 失败往往处于隐蔽状态,直到再也无法恢复时才暴露出来。 这表明,要提升编码 Agent 的可靠性,需要更早地进行验证与干预,而不是仅仅依赖最终结果的评估。 原文链接:https://arxiv.org/abs/2607.09510 前往小宇宙评论区与主播互动

0:00-21:12

transcript

No transcript — this publisher did not publish one.

show notes

今天的这篇的主题是:Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

Summary

大语言模型(LLM)编码 Agent(Coding agents)正越来越多地被部署于终端环境中自动执行软件工程任务,这使得它们的可靠性成为一个日益受关注的问题。现有的实证研究虽然探讨了编码 Agent 发生失败的原因,但大多将“失败”视为一种最终结果而非一个时序过程,对于失败如何萌生、演化并最终变得不可逆转所提供的见解非常有限。

本文展示了首个关于命令行(CLI)编码 Agent 失败轨迹的大规模实证研究,提出了一个面向过程的框架(process-oriented framework),通过执行轨迹中的萌生(onset)、演化(evolution)和恢复(recovery)三个阶段来分析失败。

我们首先收集了由 7 个前沿模型在 3 个编码 Agent 支架(OpenHands、MiniSWE 和 Terminus2)上于 Terminal-Bench 产生的 3,843 条执行轨迹;随后对其进行细致筛选,提取出 1,794 条完整且有效的轨迹用于人工标注(包含超过 63,000 个执行步骤);并从中推导出了涵盖失败发生率、根本原因、恢复机制以及跨系统一致性等方面的 14 项研究发现

我们的研究结果表明:

  • 编码 Agent 的失败主要是由认知错误(epistemic errors)驱动的;

  • 失败通常在最初的几个执行步骤内就已开始萌生;

  • 失败往往处于隐蔽状态,直到再也无法恢复时才暴露出来。

这表明,要提升编码 Agent 的可靠性,需要更早地进行验证与干预,而不是仅仅依赖最终结果的评估。

原文链接:https://arxiv.org/abs/2607.09510


前往小宇宙评论区与主播互动
links2