
transcript
show notes
过去六年,AI 的突破常被归因于更先进的架构与训练技巧。但一组覆盖 2019—2025 年模型配方和数据语料的交叉训练实验显示:在相同算力预算下,数据端带来的训练效率提升达到 12 倍,模型端仅为 3.7 倍。
本期「Andrej Karpathy的RSS订阅清单」深度解析这项证据及其含义:模型创新并非不重要,而是更多在解决规模化训练的稳定性与可行性;真正推动预训练效率跃迁的主引擎,可能是数据的获取、筛选与策展能力。
原文链接:
https://www.dwarkesh.com/p/pretraining-progress-is-mostly-data
原文标题:Pretraining progress is mostly coming from data
主要内容:
• 跨年份交叉实验表明,数据带来的效率增益约为 12 倍,显著高于模型端的 3.7 倍。
• 模型配方与数据语料的收益大体可叠加,简单相加即可解释 88% 的评测差异。
• 架构、优化器与系统创新的核心价值,往往是让更大规模、更长训练和更庞大集群成为可能。
• 数据质量与规模不存在脱离训练尺度的绝对优劣:小模型偏好严筛数据,大模型则可能更受益于更大、更多样的语料。
• 当公开人类文本接近“数据墙”,自动化数据搜索、验证与策展或将成为下一阶段 AI 进步的重要战场。
推荐理由:
这篇文章用清晰的实验设计挑战了“模型架构主导一切”的常见叙事,也为理解数据工程、规模化训练与数据墙提供了极具价值的框架。它不是否定模型研究,而是重新定位模型与数据各自承担的角色。节目为原文深度解析,建议结合原文阅读,进一步把握实验边界与作者的完整论证。
---
「Andrej Karpathy的RSS订阅清单」为您精选全球最前沿的AI技术博客文章,深度剖析技术背后的核心洞察。
由 voieech.com 提供技术支持。





