潛空間在強化學習與代理中的意義
摘要
潛空間 (Latent Space) 在強化學習 (Reinforcement Learning, RL) 與代理 (Agent) 中,作為將高維觀測轉換為對決策充分的內部表示的核心機制。透過表示學習 (Representation Learning),代理可將觀測映射為潛在狀態,以支援策略學習、未來預測與行動選擇。在模型式強化學習 (Model-based Reinforcement Learning, MBRL) 中,潛空間進一步承載內部世界表徵,使代理能在壓縮表示上進行動態建模與規劃。此結構統一了狀態抽象、世界模型與規劃能力,並反映出現代強化學習正朝向結合表示學習與結構化決策的混合式架構 (Hybrid Architecture) 發展。
潛空間在強化學習與代理中的核心意義
在強化學習 (Reinforcement Learning, RL) 與代理 (Agent) 的研究中,潛空間 (Latent Space) 的價值,不在於單純壓縮資料,而在於把高維觀測轉成可決策、可預測、可泛化的內部表示。對代理而言,原始輸入常來自影像、感測器或多步觀測序列,直接作為策略輸入會帶來高維度、強噪聲與低效率問題。潛空間提供一種較可操作的狀態表示,使代理可以先理解環境,再根據理解結果做出行動 [3]。潛空間的關鍵在於其表示需對決策任務具備充分性,即保留影響行動結果的資訊,同時忽略與決策無關的變異。
潛空間作為狀態抽象
在 RL 中,潛空間最基本的作用,是把觀測 映射為潛在狀態 ,再由策略 進行決策。這種做法等於把「看見什麼」轉成「對行動有何意義」。從這個角度看,潛空間不是附加模組,而是狀態抽象 (State Abstraction) 的具體形式。若不同觀測對行動結果具有相近意義,模型就應把它們映射到相近的潛在表示。這樣的表示更有利於策略學習,也更有利於跨情境泛化。
內部世界表徵
現代代理不只把潛空間當作壓縮表示,還把潛空間視為內部世界表徵 (Internal World Representation)。在這種觀點下,代理不只是在外部環境中反應,而是在內部表示空間中進行預測、比較與規劃。World Models 與模型式強化學習 (Model-based Reinforcement Learning, MBRL) 方法,透過學習潛在動態,使代理能在內部空間中模擬未來狀態與行動後果 [1],[4],[5]。此類方法使潛空間不僅作為表示工具,同時作為動態建模的運算空間。
規劃能力
在涉及規劃 (Planning) 的任務中,潛空間進一步成為決策運算的基礎空間。以 MuZero 為代表的方法,透過學習隱式動態模型,將狀態轉換至潛在表示,並在該表示上進行搜尋與決策 [2]。這表示規劃過程不再直接依賴原始觀測,而是在結構化的潛空間中進行。
當潛空間具有良好的結構時,搜尋與評估可以更有效率地進行,進而降低計算成本與樣本需求。相對地,若表示品質不足,規劃效果也會受到限制。此現象反映出現代強化學習正從純粹的函數近似,轉向結合表示學習與結構化決策的混合式架構。
參考文獻
[1] D. Hafner, J. Pasukonis, J. Ba, and T. Lillicrap, ‘Mastering Diverse Domains through World Models’, Apr. 17, 2024, arXiv: arXiv:2301.04104. doi: 10.48550/arXiv.2301.04104.
[2] J. Schrittwieser et al., ‘Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model’, Nature, vol. 588, no. 7839, pp. 604–609, Dec. 2020, doi: 10.1038/s41586-020-03051-4.
[3] M. Laskin, A. Srinivas, and P. Abbeel, ‘CURL: Contrastive Unsupervised Representations for Reinforcement Learning’.
[4] D. Ha and J. Schmidhuber, ‘World Models’, Mar. 2018, doi: 10.5281/zenodo.1207631.
[5] D. Ha and J. Schmidhuber, ‘Recurrent World Models Facilitate Policy Evolution’.