在長程 Agent和coding 任務中,如何提升強化學習(RL)效率,仍是當前的核心難題。
目前,現有LLM RL流水線多采用同步、批量式流程,往往需要等待整批 rollout 完成后才能更新,效率提升受限。異步 RL雖然可緩解同步等待問題,但現有方法多側重提升系統吞吐,較少兼顧訓練穩定性與任務效果;此外,GRPO 方法依賴組式采樣,也難以直接適配異步 Agent 訓練。
(資料圖片僅供參考)
針對這個問題,來自清華大學KEG實驗室的研究團隊提出了單 rollout 異步優化(Single-rollout Asynchronous Optimization,SAO)方法。SAO 用單 rollout 采樣替代 GRPO 的組式采樣,即每個輸入任務只生成一條可立即用于訓練的 rollout ,從而降低離策略影響并提升泛化能力。
論文鏈接:https://arxiv.org/abs/2607.07508
研究結果顯示,SAO 可穩定訓練 1000 步,并在Agent 編碼和數學推理基準上持續優于 GRPO 及其變體;同時,單 rollout RL 在模擬在線學習任務中也展現出對動態環境的適應能力。
這項工作為高效 RL 訓練提供了一種可行思路,并已部署到GLM-5.2(750B-A40B)的Agent RL的訓練流水線中。
圖|SAO 在推理和代碼基準上的表現。
SAO是如何穩定異步訓練的?
在整體框架上,SAO 采用單 rollout異步優化:每個輸入任務只生成一條訓練 rollout ,完成后立即進入訓練。為了讓流程平穩運行,SAO 設計了直接雙邊重要性采樣、價值模型強化和多輪 Agent 軌跡處理機制,并擴大價值模型預訓練數據規模。具體流程如下:
1.直接雙邊重要性采樣(DIS):用于減少異步訓練中的離策略偏差。由于 rollout 生成和模型訓練不同步,SAO 無需保存大量歷史模型,直接使用 rollout 階段記錄的 token 對數概率來計算重要性采樣比,超出設定區間的 token 不參與梯度更新。
2.提高價值模型更新頻率:用于降低單 rollout 優化中的梯度估計方差。單 rollout 訓練的梯度方差更高,因此需要更可靠的價值模型估計優勢信號。SAO 解耦策略模型和價值模型的更新頻率,每更新一次策略模型,就更新兩次價值模型,從而降低訓練方差。
3.固定注意力模塊參數:負責穩定價值模型訓練。研究團隊發現,價值模型的波動主要來自全注意力層,混合專家層(MoE)相對穩定。因此,SAO 在訓練價值模型時固定注意力模塊參數,只優化 MoE 投影層,以減少價值模型訓練波動。
4.跳過觀察信息的 token 級 GAE:用于減少多輪 Agent 軌跡中的環境反饋噪聲。多輪軌跡中,模型動作和環境反饋會交替出現;如果環境觀察信息直接參與優勢計算,就會引入噪聲。因此,SAO 會跳過環境反饋的的觀察信息 token,只在模型生成的動作之間傳播優勢信號。
圖|帶有單 rollout 設計的 SAO 概覽。
SAO的實驗結果如何?
實驗結果顯示,SAO 在數學推理、代碼任務和模擬在線學習中都有更好表現;在多個基準上,它超過對應基線模型和 GRPO 系列方法,并能在較長訓練過程中保持穩定。具體結果如下:
數學推理和代碼任務
SAO 的評估覆蓋帶 Python 工具的奧賽數學推理、復雜數學問答和真實代碼修復等場景。結果顯示,SAO 在這些任務中都超過對應基線模型和 GRPO 方法。在 AIME2025 上,SAO 達到 97.3% 準確率,高于 GRPO 的 84.2%。
圖|數學推理基準上的實驗結果(準確率%)。
在代碼任務SWE-Bench Verified 上,SAO 的準確率達到 29.8%,也高于基線模型的 23.0% 和 GRPO(w/ DIS)的 27.0%。
圖|SWE-Bench Verified 上的實驗結果。
訓練穩定性
從訓練曲線看,SAO 在不同基準上基本保持領先,訓練過程也更穩定。普通 GRPO 較早出現性能崩潰;加入 DIS 后,GRPO 可以穩定訓練,說明直接雙邊重要性采樣能過濾偏離過大的 token 更新;相比之下,SAO 在保持穩定的同時,訓練中后期評估表現繼續提升。
圖|SAO 與 GRPO(w/ DIS)在訓練過程中的性能比較。
訓練動態
實驗結果顯示,SAO 的穩定性與其框架設計相關。更頻繁的價值模型更新使價值估計與真實回報更一致;固定注意力模塊參數后,價值模型訓練更平穩;DIS 則通過過濾偏離過大的 token 更新來控制離策略影響。相比之下,基于價值模型的 VAPO 對照方法若不使用 DIS,會在約 90 step 時出現訓練崩潰。
圖|異步單 rollout 強化學習的訓練動態。
消融實驗
研究團隊進一步檢驗了各項框架設計的作用。他們分別調整了 SAO 的關鍵組件:減少價值模型更新次數、改用全參數價值模型訓練,并加入未使用 DIS 的 VAPO 對照和滑動平均基線。結果顯示,這些設置的表現都低于完整 SAO;在 BeyondAIME 上,完整 SAO 的準確率為 74.8%,去掉更快價值更新后,準確率降至 69.8%。
圖|價值模型訓練策略和 critic 更新頻率的消融結果。
在線學習模擬
研究團隊通過模擬在線寫作任務測試 SAO 在非平穩環境中的適應能力。任務中,獎勵偏好會在可愛風、中二風和古典風之間切換。結果顯示,SAO 能在獎勵偏好切換后快速對齊新的目標風格,并在訓練獎勵上保持更高水平;相比之下,滑動平均基線存在明顯適應滯后,收斂水平也更低。
圖|變化寫作風格偏好下的在線學習模擬。
不足和未來方向
不過,研究團隊指出,盡管 SAO 在多類 Agent 任務中表現穩定,仍存在適用范圍、部署基礎設施和真實在線應用限制。若要擴展到更廣泛場景,仍需要解決以下問題:
1.驗證更廣泛的適用性
當前實驗主要集中在基于 Qwen3-30B-A3B 的大規模 Agent 推理、代碼任務和模擬在線寫作任務上。未來,仍需驗證 SAO 是否能夠遷移到更小模型、非 Agent 類型的 RLHF 場景,以及獎勵更密集、rollout 更短的任務環境中。
2. 完善部署基礎設施
SAO 依賴訓練好的價值模型和rollout 對數概率。未來若要實際部署,需要訓練基礎設施在異步生成過程中可靠保存這些概率信息。
3. 完善真實在線適應的安全保障
在線學習實驗仍停留在受控模擬環境。研究團隊指出,未來若要用于真實用戶場景,還需要更強的安全防護、監控機制和隱私審查。
4.加強發布與監控機制
研究團隊指出,如果系統缺少適當的數據過濾、訪問控制和評估機制,SAO 相關能力可能被用于優化有害目標。未來,基于 SAO 的系統仍需要負責任的發布和持續監控。
更多技術細節,詳見原論文。
作者:夏千斯
如需轉載或投稿,請直接在本文章評論區內留言
