在线电影av不卡网址_日韩一区二区三区四区_亚洲日韩欧美视频_国产盗摄一区二区三区

您當前的位置 : 首頁 >焦點 > 正文

強化學習新突破!清華團隊提出「單rollout異步優化」方法,可穩定訓練1000步|時訊

時間:2026-07-15 10:34:22     來源:學術頭條

在長程 Agent和coding 任務中,如何提升強化學習(RL)效率,仍是當前的核心難題。

目前,現有LLM RL流水線多采用同步、批量式流程,往往需要等待整批 rollout 完成后才能更新,效率提升受限。異步 RL雖然可緩解同步等待問題,但現有方法多側重提升系統吞吐,較少兼顧訓練穩定性與任務效果;此外,GRPO 方法依賴組式采樣,也難以直接適配異步 Agent 訓練。


(資料圖片僅供參考)

針對這個問題,來自清華大學KEG實驗室的研究團隊提出了單 rollout 異步優化(Single-rollout Asynchronous Optimization,SAO)方法。SAO 用單 rollout 采樣替代 GRPO 的組式采樣,即每個輸入任務只生成一條可立即用于訓練的 rollout ,從而降低離策略影響并提升泛化能力。

論文鏈接:https://arxiv.org/abs/2607.07508

研究結果顯示,SAO 可穩定訓練 1000 步,并在Agent 編碼和數學推理基準上持續優于 GRPO 及其變體;同時,單 rollout RL 在模擬在線學習任務中也展現出對動態環境的適應能力。

這項工作為高效 RL 訓練提供了一種可行思路,并已部署到GLM-5.2(750B-A40B)的Agent RL的訓練流水線中。

圖|SAO 在推理和代碼基準上的表現。

SAO是如何穩定異步訓練的?

在整體框架上,SAO 采用單 rollout異步優化:每個輸入任務只生成一條訓練 rollout ,完成后立即進入訓練。為了讓流程平穩運行,SAO 設計了直接雙邊重要性采樣、價值模型強化和多輪 Agent 軌跡處理機制,并擴大價值模型預訓練數據規模。具體流程如下:

1.直接雙邊重要性采樣(DIS):用于減少異步訓練中的離策略偏差。由于 rollout 生成和模型訓練不同步,SAO 無需保存大量歷史模型,直接使用 rollout 階段記錄的 token 對數概率來計算重要性采樣比,超出設定區間的 token 不參與梯度更新。

2.提高價值模型更新頻率:用于降低單 rollout 優化中的梯度估計方差。單 rollout 訓練的梯度方差更高,因此需要更可靠的價值模型估計優勢信號。SAO 解耦策略模型和價值模型的更新頻率,每更新一次策略模型,就更新兩次價值模型,從而降低訓練方差。

3.固定注意力模塊參數:負責穩定價值模型訓練。研究團隊發現,價值模型的波動主要來自全注意力層,混合專家層(MoE)相對穩定。因此,SAO 在訓練價值模型時固定注意力模塊參數,只優化 MoE 投影層,以減少價值模型訓練波動。

4.跳過觀察信息的 token 級 GAE:用于減少多輪 Agent 軌跡中的環境反饋噪聲。多輪軌跡中,模型動作和環境反饋會交替出現;如果環境觀察信息直接參與優勢計算,就會引入噪聲。因此,SAO 會跳過環境反饋的的觀察信息 token,只在模型生成的動作之間傳播優勢信號。

圖|帶有單 rollout 設計的 SAO 概覽。

SAO的實驗結果如何?

實驗結果顯示,SAO 在數學推理、代碼任務和模擬在線學習中都有更好表現;在多個基準上,它超過對應基線模型和 GRPO 系列方法,并能在較長訓練過程中保持穩定。具體結果如下:

數學推理和代碼任務

SAO 的評估覆蓋帶 Python 工具的奧賽數學推理、復雜數學問答和真實代碼修復等場景。結果顯示,SAO 在這些任務中都超過對應基線模型和 GRPO 方法。在 AIME2025 上,SAO 達到 97.3% 準確率,高于 GRPO 的 84.2%。

圖|數學推理基準上的實驗結果(準確率%)。

在代碼任務SWE-Bench Verified 上,SAO 的準確率達到 29.8%,也高于基線模型的 23.0% 和 GRPO(w/ DIS)的 27.0%。

圖|SWE-Bench Verified 上的實驗結果。

訓練穩定性

從訓練曲線看,SAO 在不同基準上基本保持領先,訓練過程也更穩定。普通 GRPO 較早出現性能崩潰;加入 DIS 后,GRPO 可以穩定訓練,說明直接雙邊重要性采樣能過濾偏離過大的 token 更新;相比之下,SAO 在保持穩定的同時,訓練中后期評估表現繼續提升。

圖|SAO 與 GRPO(w/ DIS)在訓練過程中的性能比較。

訓練動態

實驗結果顯示,SAO 的穩定性與其框架設計相關。更頻繁的價值模型更新使價值估計與真實回報更一致;固定注意力模塊參數后,價值模型訓練更平穩;DIS 則通過過濾偏離過大的 token 更新來控制離策略影響。相比之下,基于價值模型的 VAPO 對照方法若不使用 DIS,會在約 90 step 時出現訓練崩潰。

圖|異步單 rollout 強化學習的訓練動態。

消融實驗

研究團隊進一步檢驗了各項框架設計的作用。他們分別調整了 SAO 的關鍵組件:減少價值模型更新次數、改用全參數價值模型訓練,并加入未使用 DIS 的 VAPO 對照和滑動平均基線。結果顯示,這些設置的表現都低于完整 SAO;在 BeyondAIME 上,完整 SAO 的準確率為 74.8%,去掉更快價值更新后,準確率降至 69.8%。

圖|價值模型訓練策略和 critic 更新頻率的消融結果。

在線學習模擬

研究團隊通過模擬在線寫作任務測試 SAO 在非平穩環境中的適應能力。任務中,獎勵偏好會在可愛風、中二風和古典風之間切換。結果顯示,SAO 能在獎勵偏好切換后快速對齊新的目標風格,并在訓練獎勵上保持更高水平;相比之下,滑動平均基線存在明顯適應滯后,收斂水平也更低。

圖|變化寫作風格偏好下的在線學習模擬。

不足和未來方向

不過,研究團隊指出,盡管 SAO 在多類 Agent 任務中表現穩定,仍存在適用范圍、部署基礎設施和真實在線應用限制。若要擴展到更廣泛場景,仍需要解決以下問題:

1.驗證更廣泛的適用性

當前實驗主要集中在基于 Qwen3-30B-A3B 的大規模 Agent 推理、代碼任務和模擬在線寫作任務上。未來,仍需驗證 SAO 是否能夠遷移到更小模型、非 Agent 類型的 RLHF 場景,以及獎勵更密集、rollout 更短的任務環境中。

2. 完善部署基礎設施

SAO 依賴訓練好的價值模型和rollout 對數概率。未來若要實際部署,需要訓練基礎設施在異步生成過程中可靠保存這些概率信息。

3. 完善真實在線適應的安全保障

在線學習實驗仍停留在受控模擬環境。研究團隊指出,未來若要用于真實用戶場景,還需要更強的安全防護、監控機制和隱私審查。

4.加強發布與監控機制

研究團隊指出,如果系統缺少適當的數據過濾、訪問控制和評估機制,SAO 相關能力可能被用于優化有害目標。未來,基于 SAO 的系統仍需要負責任的發布和持續監控。

更多技術細節,詳見原論文。

作者:夏千斯

如需轉載或投稿,請直接在本文章評論區內留言

標簽: 軌跡 實驗 強化學習 rollout

主站蜘蛛池模板: 不卡视频一区| 亚洲精品国产一区| 日韩中文字幕网| 国产精品99久久久久久久| 日韩精品手机在线观看| 亚洲国产日韩美| 国产精品久久波多野结衣| 久久免费视频观看| 日韩福利在线| 国产精品视频自在线| 青青草精品视频在线| 日本视频一区二区不卡| 久久久久亚洲av无码专区喷水| 欧美 日韩 国产在线观看| 国产欧美日韩亚洲精品| 成人a在线观看| 国产精品高清网站| 国产成人精品999| 国产成人在线一区| 日日噜噜噜夜夜爽亚洲精品| 久久国产精彩视频| 午夜精品免费视频| 亚洲综合精品一区二区| 午夜精品三级视频福利| 国产亚洲精品自在久久| 日本一区免费| 亚洲自拍欧美另类| 久久中文字幕在线视频V| 九九久久九九久久| 久久综合久中文字幕青草| 国产精品老女人精品视频| 91九色国产ts另类人妖| 国产精品av电影| 精品无码一区二区三区爱欲| 亚洲二区自拍| 亚洲国产精品影视| 日本亚洲欧美三级| 色99中文字幕| 国产精品1234| wwwwww欧美| 久久久国产视频|