人工智慧代理(AI Agent)
人工智慧代理(AI agent)是理解與設計人工智慧系統的一個統一框架。代理從環境取得感知(percept),依據既有知識、內部狀態、目標或效用進行決策,再透過執行器採取行動。這個框架描述的是系統如何在環境中運作,因此不等同於某一種特定學習方法;機器學習、深度學習與強化學習都可以被納入代理的感知、決策或學習機制之中。[1]
以 PEAS 描述任務環境
設計代理的第一步,是明確描述其任務環境。PEAS 以四個要素界定代理要完成的工作,以及代理能感知和影響的範圍:[1]
| 要素 | 說明 | 自動駕駛示例 |
|---|---|---|
| 表現評估(Performance measure) | 判斷任務完成品質的標準 | 安全、抵達目的地、乘客舒適、遵守交通規則 |
| 環境(Environment) | 代理運作並與之互動的外部世界 | 道路、其他車輛、行人、天氣 |
| 執行器(Actuators) | 代理能對環境施加的行動 | 轉向、加速、煞車 |
| 感測器(Sensors) | 代理用來取得環境資訊的機制 | 攝影機、雷達、GPS |
PEAS 的作用不是直接決定演算法,而是先界定問題邊界。若任務的表現標準或可用感測資訊未被說明,後續的模型設計與實驗比較就缺乏明確基礎。
任務環境的主要性質
環境性質會影響代理需要的記憶、推理、規劃與學習能力。實際任務通常同時具備多種性質,而不是只能歸入單一類別。[1]
- 可觀察性(observable):若感知足以取得決策所需的完整狀態,環境較接近完全可觀察;若資訊不完整、含噪聲或受到遮蔽,則屬部分可觀察。
- 代理數量(single-agent / multiagent):單一代理主要處理自身與環境的互動;多代理環境則還涉及其他代理的合作、競爭或策略反應。
- 確定性(deterministic / stochastic):在確定性環境中,狀態與行動大致決定後續結果;隨機性環境則包含不可預測或只能以機率描述的變化。
- 情節性與序列性(episodic / sequential):情節性任務中,各次決策相對獨立;序列性任務中,當前行動會影響後續狀態與可選行動。
- 靜態性與動態性(static / dynamic):代理思考時環境若不變,較接近靜態;環境會自行變化或受時間影響,則屬動態。
- 離散性與連續性(discrete / continuous):狀態、時間或行動若可數,屬離散;若在連續範圍中變化,則屬連續。
- 已知性與未知性(known / unknown):已知性描述代理是否掌握環境的規則或行動結果;未知環境則需要透過探索、學習或推論逐步建立模型。
其中,「可觀察性」描述代理取得資訊的程度,「已知性」則描述代理對環境規則的理解程度;兩者不能互相替代。代理可能看得到環境,卻不知道行動會產生什麼結果,也可能知道規則,卻只能取得部分觀察。
代理架構的能力層次
以下五類是代理程式的典型架構。它們主要表示決策所依賴的資訊與能力逐步增加,不代表所有實際系統都會依序、單獨使用其中一類。[1]
簡單反射型代理(Simple reflex agent)
代理只根據當前感知套用條件—行動規則,不保存感知歷史,也不明確推論環境狀態。例如,清潔代理偵測到地面髒污便立即清潔。這類架構適合狀態容易觀察且行動後果簡單的任務,但在資訊不完整或需要長期規劃時能力有限。
基於模型的反射型代理(Model-based reflex agent)
代理利用感知歷史維護內部狀態,並以環境模型推論目前未直接觀察到的部分。例如,自動駕駛代理在感測器暫時受遮蔽時,仍可根據先前觀察估計附近車輛的位置與速度。這種架構不等於完整理解世界,而是以模型支援在部分可觀察環境中的決策。
目標導向型代理(Goal-based agent)
代理將目標納入決策,評估可能行動是否有助於達成目標,因此能進行搜尋、規劃或路徑選擇。相較於固定規則,目標導向型代理能因應不同情境選擇行動;但若多個方案都能達成目標,它本身未必能充分比較各方案的品質。
效用導向型代理(Utility-based agent)
代理以效用函數(utility function)表示對不同結果的偏好,並在多個可行方案之間比較其價值。例如,自動駕駛系統可以同時考量安全、時間、舒適度與能源消耗。效用導向不只回答「能否達成目標」,也進一步回答「哪一個結果較好」;在序列決策中,效用評估可與價值函數及相關決策模型連結,但不能將效用函數直接等同於貝爾曼方程式。
學習型代理(Learning agent)
學習型代理能根據經驗修正自身的知識、模型、策略或效用評估,逐步改善行為。學習可以與監督式學習、非監督式學習或強化學習結合;因此,學習型代理是較廣的架構概念,強化學習只是其中一種實現決策改善的方法。學習型代理也不保證必然達到全域最佳化,其表現仍取決於資料、回饋、探索方式、模型限制與任務環境。
代理框架的意義與限制
代理框架將人工智慧問題連結為一個完整循環:感知環境、形成或更新狀態、依據目標或效用選擇行動,並在需要時從結果中學習。PEAS 幫助研究者界定任務,環境性質幫助研究者判斷不確定性與互動條件,而代理架構則說明系統需要哪些決策能力。這三者共同構成從問題分析到系統設計的基本脈絡。
不過,這些分類是分析工具,不是對現代 AI 系統的完整描述。實際系統可能同時包含模型推論、規劃、效用評估與學習模組;「代理」也只說明系統如何與環境互動,並不自動保證系統具有人類式理解、自主性或可靠性。因此,分析一個具體 AI agent 時,仍需另行說明其任務、資料、模型、控制範圍與評估標準。
結語
人工智慧代理提供了一個以環境互動為中心的概念框架。透過 PEAS 可以界定任務,透過環境性質可以分析決策條件,再以由反射、模型、目標、效用到學習的架構理解代理能力如何增加。這個框架的價值不在於替所有 AI 方法提供單一分類,而在於協助研究者清楚說明:代理感知什麼、能做什麼、如何評估行動,以及如何在經驗中改善決策。
參考文獻
[1] S. Russell and P. Norvig, Artificial Intelligence: A Modern Approach, 4th ed. Hoboken, NJ, USA: Pearson, 2020. [Online]. Available: https://aima.cs.berkeley.edu/global-index.html
