
transcript
show notes
AI 後訓練讓模型更穩定,也把不少題目推向必中或永遠解不出,多試會中的題變少,狂按重新生成可能因此救不回難題。這份模型訓練研究也提出 PTGS,依難度調整隨機性。
⭐ 文章深度讀:AI 狂按重新生成為什麼救不回難題?後訓練灌了鉛的骰子
→ https://heymaibao.com/post-training-loaded-dice-regenerate-0d72fc/
⚡ 章節重點
重按救不回的難題 00:00
後訓練與灌鉛的骰子 00:30
被磨掉的中間地帶 02:04
調隨機性的極限與解法 02:58
換問法與穩定的代價 04:38
📝 懶人包
∙ 後訓練讓題目往兩端集中:每次都解出來,或永遠解不出來。
∙ gemma-4-31B 在 WebShop 經後訓練,多試會中的題剩 30.0%
∙ PTGS 讓一般訓練弄丟的題目找回大約一半。
∙ 我的觀點:卡在同一個錯答案時,換問法或換工具比重按更可能有用。
📚 參考資料
arXiv 2610.01509
→ https://arxiv.org/html/2610.01509v1
Sharpening Tax in Post-Training 程式碼
→ https://github.com/changdaeoh/sharpening-tax
基礎模型 - 維基百科,自由的百科全書
→ https://zh.wikipedia.org/zh-tw/%E5%9F%BA%E7%A1%80%E6%A8%A1%E5%9E%8B
Reinforcement Learning from Human Feedback
→ https://arxiv.org/html/2504.12501v6
Does Reinforcement Learning Really Incentivize …
→ https://arxiv.org/abs/2504.13837