Prefix-RFT 是什麼?用部分示範結合 SFT 與 RFT
Prefix-RFT 是一種把示範學習與強化式微調放進同一個訓練流程的方法。它不是「只給模型看一小段答案就一定變強」的通用技巧,而是 2025 年論文〈Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling〉在數學推理任務上提出的後訓練方法。閱讀它時,應把論文結果與實際部署分開:作者在特定模型、資料、獎勵設計與基準測試下觀察到效果,並不等同所有領域都會得到相同增益。
SFT 與 RFT 的取捨
監督式微調(SFT)會讓模型模仿高品質示範的輸出。它容易穩定地學到格式、風格與既有解題路徑,但如果過度依賴固定示範,也可能只是在複製表面行為,面對變形題時泛化不足。
強化式微調(RFT)則讓模型產生自己的回答,再透過獎勵訊號調整策略。這可鼓勵探索並直接最佳化任務目標,但效果會受初始模型、獎勵函數、取樣策略與訓練穩定性影響;若獎勵設計不完整,模型也可能學到不符合原意的捷徑。
Prefix-RFT 的核心:示範開頭 + 模型續寫
Prefix-RFT 不要求模型完整照抄示範,也不完全從空白開始探索。論文的做法是:從高品質示範中抽取一段前綴,將它與題目提供給模型,接著讓模型自行生成後續解題內容。這個「示範前綴 + 模型續寫」的組合會被視為一條訓練軌跡,並與一般模型 rollout 一起參與 RFT 更新。
直覺上,前綴提供一個較可能正確的起點,降低純探索一開始就偏離的機率;續寫部分仍保留模型選擇下一步策略的空間,因此不必被完整示範綁死。若續寫結果獲得較高獎勵,對應的軌跡便會強化;這也是它試圖在模仿與探索之間取得平衡的地方。
它與「先 SFT、再 RFT」有何不同?
常見流程是先用完整資料做 SFT,再以 RFT 進一步最佳化。Prefix-RFT 的重點不是只調整兩個訓練階段的順序,而是在 RFT 過程中直接把示範前綴混入軌跡:前段是離線示範,後段是當前模型的 on-policy 續寫。論文將這種混合視為統一的訓練觀點,並與單獨 SFT、單獨 RFT、兩階段流程和其他混合策略比較。
論文證據能支持到哪裡?
作者以數學推理問題作為測試平台,報告 Prefix-RFT 在其實驗設定下優於多個對照方法,並對示範品質與數量做了消融分析。這些結果很有參考價值,但仍應注意範圍:資料集、基礎模型、獎勵驗證器、訓練預算與評測基準都會影響結果;論文中的「優於」不能直接外推到客服、文件撰寫、程式代理或高風險決策。
此外,該論文首先以 arXiv 預印本形式公開。實作者應追蹤版本、同儕審查狀態與後續重現報告,而不是只根據二手摘要決定訓練策略。
實作前需要準備什麼?
- 可驗證的任務目標:數學題可用答案或規則驗證器;若任務沒有可靠獎勵,RFT 可能只會放大不一致的評分。
- 高品質、可追溯的示範:前綴品質會影響模型從哪裡開始探索。需要檢查資料正確性、來源授權、格式與是否混入測試集。
- 前綴取樣設計:記錄前綴長度或比例的分布、隨機種子與資料切分;不同取樣策略會改變模仿與探索的比例。
- 穩定的 RFT 管線:保留基礎模型版本、獎勵函數、rollout 設定、batch/學習率與計算預算,否則無法判斷提升來自方法還是設定差異。
- 獨立評測:使用未見題目、固定評測腳本與多個隨機種子,並檢查是否出現資料洩漏或只對單一指標最佳化。
如何設計公平的驗證實驗?
- 先凍結基礎模型、訓練資料切分與總計算預算。
- 建立 SFT、RFT、SFT 後 RFT 與 Prefix-RFT 等對照組,避免只和弱基準比較。
- 讓各組使用同一套答案驗證、停止條件與推論設定。
- 除主要數學基準外,也測試不同難度、不同題型與資料外分布,確認不是只記住訓練型態。
- 記錄平均值、變異、失敗樣本與訓練成本;若提升小於種子波動或成本差異,不能直接宣稱方法較好。
哪些情況不宜直接套用?
若示範資料品質未知、獎勵函數無法可靠判定對錯、任務牽涉醫療、金融、法律或安全關鍵決策,不能只靠 Prefix-RFT 的結果來授權模型行動。這些場景還需要專家覆核、風險控制、審計紀錄與針對實際工作流程的評估。即使在數學任務有效,也仍要評估訓練成本、推論延遲與後續維護是否合理。
結論
Prefix-RFT 提供了一個清楚的研究想法:讓示範負責指引起點,讓強化學習負責探索後續路徑。它的價值不在於宣稱「部分示範一定能提升所有推理」,而在於提供可被比較、消融與重現的混合訓練設計。若要採用,應先確保示範品質、獎勵可靠度、對照實驗與安全邊界都足夠清楚。














