Skip to content
Artwork for 脈報
脈報 · Monday · 6 min

AI 狂按重新生成為什麼救不回難題?後訓練灌了鉛的骰子 (穩定交差的代價)

AI 後訓練讓模型更穩定,也把不少題目推向必中或永遠解不出,多試會中的題變少,狂按重新生成可能因此救不回難題。這份模型訓練研究也提出 PTGS,依難度調整隨機性。 ⭐ 文章深度讀:AI 狂按重新生成為什麼救不回難題?後訓練灌了鉛的骰子 → https://heymaibao.com/post-training-loaded-dice-regenerate-0d72fc/ ⚡ 章節重點 重按救不回的難題 00:00 後訓練與灌鉛的骰子 00:30 被磨掉的中間地帶 02:04 調隨機性的極限與解法 02:58 換問法與穩定的代價 04:38 📝 懶人包 ∙ 後訓練讓題目往兩端集中:每次都解出來,或永遠解不出來。 ∙ gemma-4-31B 在 WebShop 經後訓練,多試會中的題剩 30.0% ∙ PTGS 讓一般訓練弄丟的題目找回大約一半。 ∙ 我的觀點:卡在同一個錯答案時,換問法或換工具比重按更可能有用。 📚 參考資料 arXiv 2610.01509 → https://arxiv.org/html/2610.01509v1 Sharpening Tax in Post-Training 程式碼 → https://github.com/changdaeoh/sharpening-tax 基礎模型 - 維基百科,自由的百科全書 → https://zh.wikipedia.org/zh-tw/%E5%9F%BA%E7%A1%80%E6%A8%A1%E5%9E%8B Reinforcement Learning from Human Feedback → https://arxiv.org/html/2504.12501v6 Does Reinforcement Learning Really Incentivize … → https://arxiv.org/abs/2504.13837

0:00-6:07

transcript

No transcript — this publisher did not publish one.

show notes


AI 後訓練讓模型更穩定,也把不少題目推向必中或永遠解不出,多試會中的題變少,狂按重新生成可能因此救不回難題。這份模型訓練研究也提出 PTGS,依難度調整隨機性。

⭐ 文章深度讀:AI 狂按重新生成為什麼救不回難題?後訓練灌了鉛的骰子
→ https://heymaibao.com/post-training-loaded-dice-regenerate-0d72fc/

⚡ 章節重點
重按救不回的難題 00:00
後訓練與灌鉛的骰子 00:30
被磨掉的中間地帶 02:04
調隨機性的極限與解法 02:58
換問法與穩定的代價 04:38

📝 懶人包
∙ 後訓練讓題目往兩端集中:每次都解出來,或永遠解不出來。

∙ gemma-4-31B 在 WebShop 經後訓練,多試會中的題剩 30.0%

∙ PTGS 讓一般訓練弄丟的題目找回大約一半。

∙ 我的觀點:卡在同一個錯答案時,換問法或換工具比重按更可能有用。

📚 參考資料
arXiv 2610.01509
→ https://arxiv.org/html/2610.01509v1

Sharpening Tax in Post-Training 程式碼
→ https://github.com/changdaeoh/sharpening-tax

基礎模型 - 維基百科,自由的百科全書
→ https://zh.wikipedia.org/zh-tw/%E5%9F%BA%E7%A1%80%E6%A8%A1%E5%9E%8B

Reinforcement Learning from Human Feedback
→ https://arxiv.org/html/2504.12501v6

Does Reinforcement Learning Really Incentivize …
→ https://arxiv.org/abs/2504.13837

links6