部分可觀測馬可夫決策過程(Partially Observable Markov Decision Process, POMDP)
摘要
部分可觀測馬可夫決策過程(Partially Observable Markov Decision Process, POMDP)描述代理人(agent)在資訊不完全的情況下進行序列決策的問題。與可完全觀測的情境不同,代理人無法直接取得真實狀態,因此決策需建立在對狀態的機率估計之上。核心在於引入信念狀態(belief state)作為內部表示,將不可觀測問題轉化為可處理的決策形式,進而在信念空間上推導最優策略(optimal policy)[1]
背景與問題建構
在經典馬可夫決策過程(Markov Decision Process, MDP)中,代理人被假設可以完全觀測當前狀態,因此決策僅依賴 。然而在真實環境中,感測噪聲與環境不確定性使得狀態不可直接取得,決策問題因此轉為在不完全資訊下進行推斷與行動。
POMDP 將觀測(observation)與狀態區分開來,代理人只能接收 ,並需結合歷史資訊推斷潛在狀態。此設定使決策不再依賴單一狀態,而是依賴對狀態的機率估計。此估計即為信念狀態,並構成代理人進行決策的基礎表示。
在形式上,POMDP 可表示為
其中 為狀態集合, 為動作集合, 為狀態轉移機率, 為回饋函數, 為觀測集合, 為觀測機率, 為折扣因子。
表示與更新機制
由於真實狀態不可觀測,代理人無法直接基於 決策,必須透過信念狀態 作為替代表示,即對真實狀態的機率分佈。信念狀態將歷史觀測與行動壓縮為當前的機率估計,使決策建立在可處理的形式之上。
在此框架中,信念會隨觀測與行動進行更新,其形式可寫為
其中 為正規化常數。此更新過程對應 貝葉斯濾波(Bayesian Filtering),使代理人能在不完全資訊下持續修正對狀態的估計,並在此基礎上進行決策。
特性
在信念狀態的表示下,POMDP 將歷史觀測與行動整合為對真實狀態的機率分佈,使其成為充分統計量(sufficient statistic)。因此,決策問題可轉化為在信念空間上最大化期望回報的最適控制問題。
然而,此轉換同時帶來顯著的計算複雜度。信念空間為連續且高維,其對應的最優值函數呈現分段線性且凸的結構,該結構在一般情況下難以精確表示與更新,使問題從離散狀態空間的 MDP 提升為連續空間上的最佳化問題。
此外,行動不僅影響環境狀態,也影響未來可獲得的資訊,因此模型中自然包含資訊價值的權衡,使探索與利用之間的取捨成為決策的一部分。
總結
POMDP 將不完全資訊下的決策問題形式化為信念空間上的最適控制問題,使推斷與決策整合於同一框架中。透過信念狀態,代理人得以在不可觀測環境中進行一致的策略推導,並構成強化學習與機率推論之間的關鍵連接。
