
transcript
show notes
当复刻 GPT-2 的模型在架构和训练规模都接近原版时,差距究竟来自哪里?Giles Thomas 将焦点转向训练数据质量:FineWeb-Edu、OpenWebText、百科混合语料的对照实验显示,预训练损失的优劣并不等同于指令能力的强弱。
更重要的是,作者在复查实验流程时发现,部分训练集意外混入了原本保留的测试文本,最高涉及实际训练内容的 15.21%。这篇文章不仅呈现了一次严谨的 GPT-2 复刻调查,也提醒我们:数据泄漏、评测集分布与随机种子波动,都可能让看似明确的模型结论变得需要重新审视。
原文链接:
https://www.gilesthomas.com/2026/10/why-do-openai-gpt2-weights-beat-mine-5-data-quality
原文标题:Why do OpenAI's GPT-2 weights beat mine? Part five: data quality
主要内容:
• 作者以约 1.63 亿参数的 GPT-2 类模型为对象,使用四类语料各训练约 32 亿 token,检验数据质量是否能解释与 GPT-2 small 的性能差距。
• 在 FineWeb 测试集上,训练数据中 FineWeb 占比越高,损失通常越低;但这一指标更可能衡量模型对特定文本分布的熟悉度。
• 经 Alpaca 指令微调并由 GPT-5.5 评估后,FineWeb-Edu 模型获得 24.56 分,接近 GPT-2 small 的 25.19,显著高于 FineWeb 对照组的 17.90。
• 两个混合语料实验发生测试集泄漏:五五混合模型的前 32 亿训练 token 中,约 15.21% 来自测试文本;百科混合模型则为约 13.66%。
• 作者指出,单次训练的指令评分可波动 3.05 分,且 GPT-2 在微调时的权重共享设置也可能影响结果;数据质量的作用仍需多随机种子复现实验确认。
推荐理由:
这是一篇难得把“复现失败”完整摊开来检查的技术文章。它不只讨论哪种语料更好,更直面实验研究中最容易被忽略的陷阱:测试集泄漏、分布偏置、评测指标错配与训练随机性。对于关注大模型预训练、数据治理、模型评估和可复现实验的读者,这篇原文值得细读。
---
「Andrej Karpathy的RSS订阅清单」为您精选全球最前沿的AI技术博客文章,深度剖析技术背后的核心洞察。
由 voieech.com 提供技术支持。





