
transcript
show notes
CIS 針對模型訓練時兩套引擎的機率落差,只剪往上偏的異常大落差,讓修正上限隨 token 把握程度收緊。剪掉數量相近的固定上限反而傷訓練,CIS 每步計算時間只多 3.2%。
⭐ 文章深度讀:AI 模型訓練誤差怎麼修?CIS 論文發現剪在哪比剪多少重要
→ https://heymaibao.com/cis-rl-training-mismatch-where-to-clip-4b148d/
⚡ 章節重點
剪在哪裡的問題 00:00
兩台機器的落差 00:32
舊修法與 CIS 01:53
落刀點的實驗證據 03:32
成績單與它的問號 04:39
不起眼的工程細節 06:18
📝 懶人包
∙ 訓練與推論引擎載同一組參數,對同一個 token 算出的機率仍不同。
∙ 舊修正法的固定門檻,實際上主要剪在模型沒把握的 token 上。
∙ 剪掉數量跟 CIS 差不多的固定上限,訓練反而受傷。
∙ 我的觀點:修正訓練落差時,刀落在哪裡比剪多少更要緊。
📚 參考資料
Rethinking Training–Inference Mismatch inLLM Reinforcement Learning:Where It Arises and How to Correct It
→ https://arxiv.org/html/2609.32444v1
GitHub - kzhao5/CIS-RL
→ https://github.com/kzhao5/CIS-RL
links3