Skip to content
Artwork for 脈報
脈報 · September 29 · 7 min

AI 模型訓練誤差的舊修法一直剪錯地方?CIS 論文發現剪在哪比剪多少重要

CIS 針對模型訓練時兩套引擎的機率落差,只剪往上偏的異常大落差,讓修正上限隨 token 把握程度收緊。剪掉數量相近的固定上限反而傷訓練,CIS 每步計算時間只多 3.2%。 ⭐ 文章深度讀:AI 模型訓練誤差怎麼修?CIS 論文發現剪在哪比剪多少重要 → https://heymaibao.com/cis-rl-training-mismatch-where-to-clip-4b148d/ ⚡ 章節重點 剪在哪裡的問題 00:00 兩台機器的落差 00:32 舊修法與 CIS 01:53 落刀點的實驗證據 03:32 成績單與它的問號 04:39 不起眼的工程細節 06:18 📝 懶人包 ∙ 訓練與推論引擎載同一組參數,對同一個 token 算出的機率仍不同。 ∙ 舊修正法的固定門檻,實際上主要剪在模型沒把握的 token 上。 ∙ 剪掉數量跟 CIS 差不多的固定上限,訓練反而受傷。 ∙ 我的觀點:修正訓練落差時,刀落在哪裡比剪多少更要緊。 📚 參考資料 Rethinking Training–Inference Mismatch inLLM Reinforcement Learning:Where It Arises and How to Correct It → https://arxiv.org/html/2609.32444v1 GitHub - kzhao5/CIS-RL → https://github.com/kzhao5/CIS-RL

0:00-7:04

transcript

No transcript — this publisher did not publish one.

show notes


CIS 針對模型訓練時兩套引擎的機率落差,只剪往上偏的異常大落差,讓修正上限隨 token 把握程度收緊。剪掉數量相近的固定上限反而傷訓練,CIS 每步計算時間只多 3.2%。

⭐ 文章深度讀:AI 模型訓練誤差怎麼修?CIS 論文發現剪在哪比剪多少重要
→ https://heymaibao.com/cis-rl-training-mismatch-where-to-clip-4b148d/

⚡ 章節重點
剪在哪裡的問題 00:00
兩台機器的落差 00:32
舊修法與 CIS 01:53
落刀點的實驗證據 03:32
成績單與它的問號 04:39
不起眼的工程細節 06:18

📝 懶人包
∙ 訓練與推論引擎載同一組參數,對同一個 token 算出的機率仍不同。

∙ 舊修正法的固定門檻,實際上主要剪在模型沒把握的 token 上。

∙ 剪掉數量跟 CIS 差不多的固定上限,訓練反而受傷。

∙ 我的觀點:修正訓練落差時,刀落在哪裡比剪多少更要緊。

📚 參考資料
Rethinking Training–Inference Mismatch inLLM Reinforcement Learning:Where It Arises and How to Correct It
→ https://arxiv.org/html/2609.32444v1

GitHub - kzhao5/CIS-RL
→ https://github.com/kzhao5/CIS-RL

links3