Skip to content
Artwork for Andrej Karpathy的RSS订阅清单
Andrej Karpathy的RSS订阅清单 · Friday · 7 min

首次披露:150行Python里,大半时间都在防AI出错

如何让语言模型在《毁灭战士》这类实时环境中,以百毫秒级速度连续决策,同时避免沦为“只会按住射击键”的反应机器?Sean Goedecke 提出了一条不同于传统 tool call 的路径:把 LLM 临时改造成只做单 token 选择的 System One 模型,再用程序结构补足它失去的规划能力。 本期深度解析文章中的两项关键设计:用分层时间循环把战略、战术与即时操作拆开;用锦标赛式采样把超大候选集重组为模型擅长的局部比较。它揭示了一个重要方向:智能不只取决于模型本身,也取决于外部程序如何组织时间与选择空间。建议结合原文阅读,了解完整实验细节与实现思路。 原文链接: https://seangoedecke.com/two-techniques-for-working-with-system-one-models/ 原文标题:Two techniques for working with System One models 主要内容: • 将 LLM 的输出限制为单个代表选项的 token,可显著减少生成、解析与工具调用开销,让实时决策从约 600ms 降至约 190ms。 • 约 150 行 Python 的基础实现中,大部分代码用于处理错误与边界情况:可靠的智能体,离不开模型之外的状态管理、验证和兜底机制。 • 快速决策会压缩规划空间。作者以慢速目标环约束高速执行环,让模型围绕稳定目标持续行动,而非每次只对眼前状态做本能反应。 • 面对 Wikipedia 上千个链接这类大候选集,绝对打分容易失效;锦标赛采样将候选分组、逐轮淘汰,更适合 LLM 的相对比较能力。 • 单 token 决策的质量还会受到标签形式、tokenizer 与任务结构影响:在不同场景中,数字索引和任意标签的效果并不相同。 推荐理由: 这篇文章的价值不只是展示“更快的 LLM”。它给出了一套可迁移的系统设计思路:模型负责局部选择,分层时间调度提供规划深度,锦标赛结构扩大可处理的选择空间,程序则承担可靠性与控制权。对实时 AI Agent、游戏 AI、机器人控制,以及任何要求低延迟且可预测行为的应用,都很有启发。 --- 「Andrej Karpathy的RSS订阅清单」为您精选全球最前沿的AI技术博客文章,深度剖析技术背后的核心洞察。 由 voieech.com 提供技术支持。

0:00-7:47

transcript

No transcript — this publisher did not publish one.

show notes

如何让语言模型在《毁灭战士》这类实时环境中,以百毫秒级速度连续决策,同时避免沦为“只会按住射击键”的反应机器?Sean Goedecke 提出了一条不同于传统 tool call 的路径:把 LLM 临时改造成只做单 token 选择的 System One 模型,再用程序结构补足它失去的规划能力。

本期深度解析文章中的两项关键设计:用分层时间循环把战略、战术与即时操作拆开;用锦标赛式采样把超大候选集重组为模型擅长的局部比较。它揭示了一个重要方向:智能不只取决于模型本身,也取决于外部程序如何组织时间与选择空间。建议结合原文阅读,了解完整实验细节与实现思路。

原文链接:
https://seangoedecke.com/two-techniques-for-working-with-system-one-models/

原文标题:Two techniques for working with System One models

主要内容:

• 将 LLM 的输出限制为单个代表选项的 token,可显著减少生成、解析与工具调用开销,让实时决策从约 600ms 降至约 190ms。

• 约 150 行 Python 的基础实现中,大部分代码用于处理错误与边界情况:可靠的智能体,离不开模型之外的状态管理、验证和兜底机制。

• 快速决策会压缩规划空间。作者以慢速目标环约束高速执行环,让模型围绕稳定目标持续行动,而非每次只对眼前状态做本能反应。

• 面对 Wikipedia 上千个链接这类大候选集,绝对打分容易失效;锦标赛采样将候选分组、逐轮淘汰,更适合 LLM 的相对比较能力。

• 单 token 决策的质量还会受到标签形式、tokenizer 与任务结构影响:在不同场景中,数字索引和任意标签的效果并不相同。

推荐理由:
这篇文章的价值不只是展示“更快的 LLM”。它给出了一套可迁移的系统设计思路:模型负责局部选择,分层时间调度提供规划深度,锦标赛结构扩大可处理的选择空间,程序则承担可靠性与控制权。对实时 AI Agent、游戏 AI、机器人控制,以及任何要求低延迟且可预测行为的应用,都很有启发。

---

「Andrej Karpathy的RSS订阅清单」为您精选全球最前沿的AI技术博客文章,深度剖析技术背后的核心洞察。
由 voieech.com 提供技术支持。