深藍背景中的青綠、紫色與暖金光帶交織延伸,象徵強化學習反覆探索與長期決策

從 Skinner 的鴿子到 AlphaGo:強化學習如何從回饋中學會決策?

「鴿子剛好在某個動作後得到食物,於是重複那個動作」常被用來解釋強化學習;AlphaGo 又常被視為強化學習的代表。兩者確實都和回饋會影響下一次選擇有關,但它們不是同一種研究,也不能直接畫上等號。

強化學習不是讓模型只要拿到分數就會變聰明,而是把一連串決策寫成可檢驗的問題:系統看見什麼、可以做哪些事、每一步得到什麼回饋、錯誤的代價是否可承受,以及長期結果該怎麼衡量。從 Skinner 的鴿子切入,剛好能幫我們先分清楚直覺與技術定義。

Skinner 的鴿子提醒我們:時間上相連,不等於因果正確

B. F. Skinner 1948 年的〈Superstition in the Pigeon〉常被引用來說明:當一個結果剛好接在某個行為後面,人或動物可能把兩者連在一起,即使那個行為不一定真正造成結果。這個案例最有價值的地方,不是把動物直接比成演算法,而是提醒我們要問:回饋真的來自這個行動嗎?還是只是碰巧同時發生?

強化學習和這個故事共享「行為會受後果影響」的直覺,但現代方法會把直覺變成明確的決策模型。它不只是記住「上次做了什麼」,而是根據狀態、行動、轉移與回饋,估計某個選擇在未來可能帶來的累積結果。Skinner 的原始研究適合用來理解回饋與行為的關係;強化學習的數學與演算法則要回到其專門文獻。

把「回饋」轉成可計算的決策循環

典型的強化學習會有一個代理人(agent)與一個環境。代理人根據目前狀態選擇行動,環境因此改變並回傳回饋;下一次決策再從新的狀態開始。目標不是只贏得眼前的一分,而是在一段連續過程中讓預期的累積回報更好。

  • 狀態(state):當下可供判斷的資訊,例如棋盤局面、機器人的位置或系統負載。
  • 行動(action):代理人此刻可採取的選擇,例如落子、調整速度或分配資源。
  • 回饋/獎勵(reward):環境回傳的訊號;它反映設計者指定的目標,不等於完整的人類價值。
  • 策略(policy):代理人在不同狀態下選擇行動的規則。
  • 價值(value):從某個狀態或行動出發,未來可能得到多少累積回報的估計。

這裡最容易被忽略的是「長期」。一個動作可能立刻有好處,卻讓後面幾步更差;也可能暫時付出成本,換來較大的未來收益。因此,強化學習需要在探索利用之間取捨:一直選已知看似最好的做法,可能錯過更佳策略;一直嘗試新做法,又會增加成本與風險。這也是為什麼真實世界的應用不能只靠「多試幾次」。

AlphaGo 的關鍵,是多個方法一起工作

2016 年發表的 AlphaGo 並非只靠「贏一局就加分」。原始論文說明,它用策略網路選擇候選著法、用價值網路評估局面,結合蒙地卡羅樹搜尋來比較後續路徑;訓練也先利用人類高手棋譜,再透過自我對弈的強化學習改善。Nature 原始論文Google DeepMind 的 AlphaGo 說明都清楚描述了這個組合。

因此,AlphaGo 的案例不該被簡化成「設定獎勵,AI 就會自己學會」。它的表現來自表徵、搜尋、訓練資料、自我對弈與評估機制的共同設計。後來的 AlphaGo Zero 採取不使用人類對局資料的自我對弈訓練,和原始 AlphaGo 的流程不同;談到兩者時,應說清楚是哪一個系統,避免把不同結果與訓練條件混在一起。

真正困難的問題:你量到的分數,是否就是想要的結果?

強化學習最棘手的風險通常不是模型不夠努力,而是目標定義得太窄。若獎勵只衡量容易計數的指標,系統可能找到提高分數、卻偏離真正目的的做法。例如,只追求完成量可能犧牲品質;只追求點擊可能忽略使用者是否得到幫助。模型不是故意「鑽漏洞」,而是在最佳化被給予的訊號。

所以獎勵函數不只是技術細節,更像是一份可測試的規格。開始訓練前,必須同時定義成功條件、不可接受的行為、需要計入的成本、何時停止探索,以及誰能覆核或中止系統。這些限制不是最後才補上的安全裝飾,而是環境與目標的一部分。

從回饋到策略,還要經過三個驗證

第一個驗證是狀態是否足夠。如果代理人看不到關鍵限制,例如資源快耗盡、感測器不可靠或使用者已經取消授權,再漂亮的策略也可能在真實情境做出錯誤選擇。第二個驗證是回饋是否可靠:延遲的結果、雜訊資料或剛好發生的事件,都可能讓系統把錯誤關係當成規律。

第三個驗證是評估能否脫離訓練環境。在固定模擬器裡拿高分,不代表進入不同資料、不同成本或不同使用者情境後仍然適用。實務上應把訓練、測試與人工審查分開,保留能重現決策的紀錄,並先在受限範圍內驗證。這些步驟看似保守,卻能避免把「模型學會迎合測試」誤認成「系統已經解決問題」。

什麼問題適合使用強化學習?

強化學習通常適合具備三個條件的任務:決策會影響後續狀態、回饋能被合理定義、而且可以在安全的模擬或低成本情境中探索。棋類、資源調度、部分機器人控制與研究型推薦策略,常符合這些特徵。

相反地,若工作只是固定規則判斷、單次分類、資料查詢或文字摘要,傳統程式、搜尋、監督式學習或規則引擎往往更直接,也更容易驗證。選擇強化學習不該因為它聽起來先進,而要因為問題真的需要連續決策與回饋循環。

開始前的 5 個檢查問題

  1. 系統每一步實際看得到哪些狀態?看不到的資訊會不會造成危險判斷?
  2. 回饋是否衡量真正的目標,而不只是容易計數的代理指標?
  3. 探索失敗的成本能否在模擬、沙盒或受限範圍內承受?
  4. 有哪些行為無論分數多高都不能做?這些限制是否能被實際執行?
  5. 是否存在更簡單、更可驗證的方法,已足以解決眼前問題?

若答案還不清楚,先縮小問題、建立模擬環境或採用較保守的方法,通常比直接讓系統在真實環境試錯更好。強化學習的價值在於能評估長期取捨,不在於讓系統不受限制地自行行動。

常見問題

強化學習就是模仿人或動物嗎?

不是。它受到心理學、控制理論、最佳化與電腦科學等領域啟發,但實際上用形式化的狀態、行動、回饋與累積回報來描述問題。人與動物的研究可以提供觀察角度,不能直接當成演算法的完整說明。

只要獎勵函數寫好,就能安全部署嗎?

不夠。還需要測試與模擬、輸入和權限限制、監控、停止機制、人工覆核與失敗紀錄。特別是會影響金錢、設備、使用者權益或公開資訊的場景,不應讓系統在沒有保護欄的情況下自行試錯。

AlphaGo 是純粹的自我學習嗎?

原始 AlphaGo 結合人類棋譜訓練、深度神經網路、樹狀搜尋與自我對弈強化學習。AlphaGo Zero 的訓練條件不同;兩者都很重要,但不應互相替代或混成同一個流程。

結語

從 Skinner 的鴿子到 AlphaGo,最值得記住的不是「獎勵能讓 AI 變聰明」,而是幾個更精確的問題:誰定義回饋?回饋是否代表真正目標?系統如何在不確定下探索?錯誤的代價由誰承擔?強化學習的力量來自可被檢驗的決策循環,而不是神祕的獎勵魔法。

延伸閱讀

Similar Posts