強化學習(Reinforcement Learning)

強化學習(Reinforcement Learning, RL)描述機器在沒有標準答案的情況下如何進行學習。在這個框架中,系統中的決策主體稱為人工智慧代理(Agent)。
強化學習不同於監督式學習(Supervised Learning)與非監督式學習(Unsupervised Learning)。此方法不依賴標記資料,也不提供明確正解。代理透過與環境互動取得回饋,並在反覆嘗試中逐步調整行為,以接近較佳結果。
運作方式
在強化學習中,代理根據當前狀態做出行動,環境回傳對應的回饋,稱為獎勵(Reward)。學習目標不是單一步驟的正確性,而是讓整體累積獎勵最大化,並形成穩定的行為策略(Policy)。
基本流程可以描述為一個循環過程。代理先觀察環境狀態,接著依據策略選擇行動。環境根據該行動給出獎勵,並轉換到新的狀態。代理根據回饋調整策略,然後進入下一輪互動。這個過程會持續進行,使策略逐步改善。
在學習過程中,代理需要在探索(Exploration)與利用(Exploitation)之間取得平衡。探索指嘗試未知行為,以發現潛在更好的策略。利用指選擇已知效果較好的行為,以穩定累積獎勵。兩者的取捨會直接影響學習效率與最終結果。
整體而言,強化學習的核心在於持續互動與回饋累積。代理不會在一開始就知道最佳行動,而是透過反覆嘗試逐步形成有效策略,同時考量短期與長期的回饋影響。
