大模型訓練必知的 Qwen3 訓練經驗

預訓練

Qwen3 分別針對通用知識、推理能力和長上下文能力三步預訓練;

  1. 通用知識訓練:4096 序列長度,30T 總 token,119 種語言和方言;該階段主要聚焦於語言結構、語法、常識與通用世界知識的學習,爲後續階段提供強大的多語言理解與生成能力支撐。

  2. 推理能力訓練:4096 序列長度,5T 總 token,學習率衰減加快,提高 STEM、編碼、推理和合成數據的比例;

  3. 上下文長度增加:32,768 序列長度,10B 總 token,75% 的文本長度在 16,384 至 32,768 token 之間,25% 的文本長度在 4,096 至 16,384 token 之間,ABF 技術,YARN 和雙塊注意力(DCA);

後訓練

思維鏈冷啓動

目標:精心挑選數據集,用於推理能力的初始冷啓動訓練,爲了在模型中灌輸基礎推理模式,而不過度強調推理性能,確保在後續強化學習(RL)階段具備更大的靈活性和提升空間。所以數據集不用太多,但需要多樣性,防止過擬合,讓模型保持一定的 “未完成性”。

數據集特點:涵蓋廣泛類別的綜合數據集,包括數學、代碼、邏輯推理和通用 STEM 問題。數據集中的每個問題都配有經過驗證的參考解答或基於代碼的測試用例。

數據集構建

  1. 查詢過濾:使用大模型移除不易驗證的 Query,包括包含多個子問題或請求通用文本生成的 Query,移除無需使用思維鏈的 Query。爲每個 Query 標註領域標籤,確保領域數據均衡;

  2. 相應過濾:使用推理大模型爲查詢過濾後的 Query 生成 N 個候選響應,對於無法生成正確回答的進行人工過濾。過濾標準:

  3. 最終答案錯誤;

  4. 包含大量重複內容;

  5. 明顯存在缺乏充分推理的猜測;

  6. 總結內容與思維過程不一致;

  7. 不恰當的語言混用和風格轉換;

  8. 與驗證集內容高度相似;

推理強化學習

數據要求:(3,995 個數據對)

  1. 未在冷啓動階段用過;

  2. 對冷啓動模型是可學習;

  3. 具有一定的難度;

  4. 覆蓋領域廣泛;

措施:

  1. 採用 GRPO 算法更新模型;

  2. 大批量 + 多 rollout 並行探索策略空間;

  3. 探索與利用平衡的動態熵控制;

  4. 離線策略訓練提高樣本利用效率;

思維模式融合

目的:將 “非思維” 能力集成到先前訓練的 “思維” 模型中,使得能夠管理和控制推理行爲。

該模式下湧現出基於停止思考時刻積累的推理內容繼續生成最終響應的能力。

措施:

  1. 對推理強化學習模型進行 SFT 微調;

  2. “思維” 數據是通過第二階段模型對第一階段的查詢進行拒絕採樣來生成;

  3. “非思維” 數據經過精心整理,覆蓋編碼、數學、指令遵循、多語言任務、創意寫作、問答和角色扮演等多樣化任務。

  4. 在系統消息中引入 / think 和 / no_think 標記來確定回答模式;確保模型輸入格式一致,對於非思維模式樣本,助手響應中會保留空的思考塊。

通用強化學習

目的:提升模型在多樣化場景中的能力和穩定性;

措施:建立一個涵蓋 20 多種任務的獎勵系統;

評估維度:

  1. 指令遵循:確保模型準確理解並遵循用戶的指令,包括與內容、格式、長度及結構化輸出,生成符合用戶期望的響應。

  2. 格式遵循:遵循特定的格式規範,如對 / think 和 / no_think 標記做出恰當響應,並在最終輸出中始終使用指定標記(如和)來分隔思考內容與回答內容。

  3. 偏好對齊:對於開放式查詢,偏好對齊側重於提升模型的實用性、吸引力和風格適配性,最終提供更自然且令人滿意的用戶體驗。

  4. Agent 能力:這涉及訓練模型通過指定接口正確調用工具。在強化學習展開過程中,允許模型與真實環境執行反饋進行完整的多輪交互循環,從而提升其在長程決策任務中的性能和穩定性。

  5. 專業場景能力:在更專業的場景中,我們針對特定上下文設計任務。例如,在 RAG 任務中,我們引入獎勵信號引導模型生成準確且符合上下文的響應,從而降低幻覺風險。

獎勵類型:

  1. 基於規則的獎勵:基於規則的獎勵已在推理強化學習階段廣泛使用,且對指令遵循和格式遵守等通用任務也很有用。精心設計的基於規則的獎勵能夠高精度評估模型輸出的正確性,避免獎勵破解等問題。

  2. 帶參考回答的基於模型的獎勵:在這種方法中,我們使用大模型 A 爲每個查詢提供一個參考回答,並讓大模型 A 根據該參考回答對當前訓練模型的響應進行評分。這種方法能夠更靈活地處理多樣化任務,無需嚴格的格式要求,避免了純基於規則的獎勵可能產生的假陰性問題。

模型蒸餾

離線策略蒸餾:學生模型學習老師模型對於兩種模式下的響應輸出,從而學會基礎推理模式和模式切換能力;

在線策略蒸餾:最小化兩種回答模式下學生與老師模型輸出 logits 的 KL 散度。

其它

效果:

  1. 數學與編程的測試集上反應了蒸餾方法在性能上顯著優於強化學習,並且它所需的 GPU 計算時間僅爲強化學習的約十分之一。

  2. 對於知識類、STEM、數學和編程任務 ,思考模式融合與通用強化學習並未帶來顯著的性能提升;

數據合成:

  1. 利用 Qwen2.5-VL 進行文本識別;

  2. 使用垂直領域模型合成領域數據;

關鍵參數與技術;

  1. Qwen3 模型使用(GQA)、SwiGLU、(RoPE)和 RMSNorm 等技術;

  2. Qwen3 引入 QK-Norm 以確保穩定訓練。

  3. Qwen3 MoE 更細粒度的專家分割;

  4. Qwen3 MoE 採用全局批處理負載均衡損失鼓勵專家專業化;

  5. Qwen3 MoE 共有 128 個專家,每個 token 會激活 8 個專家,沒有共享專家;

三階段預訓練 -> 思維鏈冷啓動 -> 推理強化學習 -> 思維模式融合 -> 通用強化學習 -> 使用大模型蒸餾預訓練好的小模型

本文由 Readfog 進行 AMP 轉碼,版權歸原作者所有。
來源https://mp.weixin.qq.com/s/QzsOU1mV-1lbbiMdkLX1Vw