人工智慧的七十年典範轉移史

摘要
人工智慧 (Artificial Intelligence, AI) 的歷史並不是單一路線的技術累積,而是一場持續七十年的方法論競爭。自 1956 年達特茅斯會議 (Dartmouth Workshop) 開始,AI 逐漸分裂為兩條核心路線:符號主義 (Symbolism) 與連結主義 (Connectionism)。前者認為智能可以被拆解為邏輯規則與符號推理,後者則主張智能應該從類似大腦神經元的網路結構中自然湧現。這場分裂不只是理論爭論,更深刻影響了研究經費、產業方向與整個計算技術的演化。神經網路曾在 1969 年後被主流學界判定為缺乏前景,並在接近四十年的時間裡處於邊緣地位。然而,深度學習 (Deep Learning) 最終重新主導 AI,並不是因為早期理論突然失效,而是因為硬體、資料規模與訓練方法在 2010 年代終於形成交會。
達特茅斯會議與人工智慧的誕生
1956 年夏天,約翰・麥卡錫 (John McCarthy)、克勞德・香農 (Claude Shannon)、馬文・明斯基 (Marvin Minsky) 等研究者在達特茅斯學院正式提出人工智慧這個名稱。麥卡錫在提案中主張,學習與智能的所有特徵原則上都可以被精確描述,因此也能被機器模擬。這個觀點奠定了 AI 作為一門獨立學科的基礎,也代表研究者首次將智能視為一種可以工程化的對象。
然而,AI 從誕生初期便隱含著一場核心分裂。赫伯特・西蒙 (Herbert Simon) 與艾倫・紐厄爾 (Allen Newell) 開發的 Logic Theorist 系統,透過人工編寫規則來證明數學定理,代表了符號主義的方向。在這條路線中,智能被理解為符號操作與邏輯推理,機器只要擁有足夠完整的規則集合,便能模擬人類思考。
另一方面,明斯基與部分研究者則對神經網路更感興趣。他們相信,人類智能並不是大量明確規則的堆疊,而是來自大量簡單神經元之間的連接與學習能力。這條路線後來被稱為連結主義 (Connectionism)。兩種方法的差異,實際上代表了 AI 歷史上最根本的問題:智能究竟應該被規則描述,還是從資料中被學習出來
神經網路的第一次放逐
1958 年,法蘭克・羅森布拉特 (Frank Rosenblatt) 發明感知機 (Perceptron)。這是一種早期神經網路,可以從資料中自行學習辨識簡單圖形,而不需要人工預先定義規則。當時媒體對感知機抱持極高期待,《紐約時報》甚至將它描述為未來可能擁有自我意識的機器原型。
但這場熱潮在 1969 年遭遇重大打擊。明斯基與西摩・派普特 (Seymour Papert) 出版《Perceptrons》,透過數學分析指出單層感知機無法處理 XOR 等非線性問題。真正改變歷史的,並不是單層感知機的數學限制,而是學術界開始將這種限制視為整條路線的終局判決。當時的學界並未將這視為尚待研究的問題,而是直接將其解讀為神經網路整體缺乏未來性。
由於明斯基在 AI 領域擁有極高權威,這場批判迅速影響整個學術與資助系統。研究經費開始撤離,博士生與教授轉向其他方向,神經網路逐漸從主流 AI 研究中消失。這段時期後來被稱為第一次 AI 寒冬 (First AI Winter)。神經網路的衰退並不完全來自技術失敗,更重要的是它失去了繼續被研究與驗證的條件。
規則智能的黃金年代
神經網路退場後,AI 研究全面轉向專家系統 (Expert Systems)。這個方向建立在一個直接而合理的假設之上:如果機器無法自己學習,那麼就由人類專家將知識逐條輸入系統。專家系統透過大量 if-then 規則進行推理,試圖模仿專業人士的決策過程。
1970 至 1980 年代,專家系統迅速獲得成功。史丹佛大學開發的 MYCIN 系統,已能在某些醫療診斷任務中接近專科醫師的表現。企業與政府因此相信,AI 的未來在於知識工程 (Knowledge Engineering)。日本政府甚至推動第五代電腦計畫 (Fifth Generation Computer Systems Project),希望建立能進行自然語言推理與智能決策的系統。
然而,專家系統很快暴露出規模化困難。隨著規則數量增加,系統的維護成本開始失控。每次新增規則都可能引發不可預測的連鎖影響,而人類專家的真正能力往往來自長期經驗形成的直覺與模式辨識,這些能力無法被完整翻譯成明確規則。專家系統因此逐漸呈現出脆弱性,它們可以在熟悉範圍內表現良好,但一旦遇到規則庫未覆蓋的情境,便容易產生錯誤且自信的判斷。
反向傳播與第二次 AI 寒冬
1986 年,傑佛瑞・辛頓 (Geoffrey Hinton)、魯梅哈特 (David Rumelhart) 與威廉斯 (Ronald Williams) 發表反向傳播 (Backpropagation) 研究,證明多層神經網路理論上可以透過誤差回傳進行學習。這項成果重新點燃部分研究者對神經網路的興趣。
然而,當時的硬體條件仍然不足。多層神經網路需要龐大的計算量與長時間訓練,而 1980 與 1990 年代的計算能力無法有效支撐這種需求。此外,梯度消失 (Vanishing Gradient)、資料量不足與訓練不穩定等問題,也讓神經網路在實務表現上持續落後於其他方法。
因此,主流學界逐漸轉向支持向量機 (Support Vector Machine, SVM) 與統計機器學習方法。AI 再次進入寒冬,企業與投資者開始撤離,人工智慧甚至成為不受歡迎的詞彙。
但在這段低潮中,辛頓等少數研究者仍然持續投入神經網路研究。他們相信問題並不在理論本身,而是在於硬體與資料規模尚未成熟。這種堅持後來成為深度學習復興的重要基礎。
算力、資料與深度學習的交會
2000 年代後,三個原本彼此獨立的因素開始同時成熟。第一是 GPU 的發展。原本為遊戲圖形設計的 GPU,因為擁有大量平行運算能力,意外成為神經網路訓練的理想硬體。第二是資料規模的爆炸性成長。李飛飛 (Fei-Fei Li) 建立的 ImageNet 提供了超過千萬張帶標註圖片,使 AI 首次擁有足夠大的視覺資料集。第三則是卷積神經網路 (Convolutional Neural Network, CNN) 等深層架構逐漸成熟。
2012 年,辛頓的學生 Alex Krizhevsky 與 Ilya Sutskever 發表 AlexNet,在 ImageNet 競賽中大幅超越傳統方法。這不只是一次普通的性能提升,而是整個 AI 方法論的轉折點。原本長期被視為邊緣方向的深度學習,突然展現壓倒性的效果。
學術界的共識因此迅速翻轉。大量研究者開始投入深度學習,頂級會議中的相關論文數量急速增加。神經網路在沉寂數十年後重新成為 AI 的核心。
人工智慧的工業化轉向
2017 年,Google 發表 Transformer 架構論文《Attention Is All You Need》,標誌著大型語言模型 (Large Language Model, LLM) 時代的開始。Transformer 不再依賴傳統循環式結構,而是透過注意力機制處理長距離資訊關聯,使模型規模得以快速擴張。
此後,AI 的發展重心開始從大學實驗室轉向大型科技企業。模型訓練成本從早期幾乎可以忽略的規模,逐漸上升到數百萬甚至上億美元。Google、Microsoft、Meta、OpenAI 等企業掌握了 GPU、資料中心與雲端基礎設施,也因此掌握了 AI 發展的主導權。
AI 不再只是學術研究,而逐漸變成現代社會的基礎設施。推薦系統、語音辨識、醫學影像分析、垃圾郵件過濾與自然語言生成,已經深度嵌入日常生活之中。與前兩次 AI 熱潮相比,當代 AI 最大的不同在於,它已經真正成為可運作的大規模產業系統。
結論
人工智慧七十年的歷史,並不是單純的技術進步史,而是一場持續循環的理論競爭與資源重分配。神經網路曾經因為硬體不足而被判定缺乏未來,但當 GPU、資料與深層架構成熟後,過去被視為不可能的方向最終成為主流。
這段歷史的重要意義,在於它揭示了一件事:研究方向的消失,很多時候不是因為理論被完全證偽,而是因為它在當下條件下無法獲得足夠資源與耐心。今日深度學習雖然已經主導 AI,但大型語言模型仍然面臨推理能力、幻覺 (Hallucination)、因果理解 (Causal Reasoning) 等問題。未來的下一次重大轉折,也許仍然會來自今日尚未被主流重視的方向。
參考文獻與關鍵人物
I. Foundational Era and Methodological Schism (1950s)
Key Figures | John McCarthy, Marvin Minsky, Claude Shannon, Herbert Simon, Allen Newell, Nathaniel Rochester
Key Events & Terms | Dartmouth Workshop, Artificial Intelligence as a research field, Logic Theorist, Symbolism, Connectionism
Core References
McCarthy, J., Minsky, M. L., Rochester, N., & Shannon, C. E. — A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence (1955)
Newell, A., Shaw, J. C., & Simon, H. A. — The Logic Theory Machine: A Complex Information Processing System (1957)
II. Perceptron Crisis and the First AI Winter (1958–1970s)
Key Figures | Frank Rosenblatt, Marvin Minsky, Seymour Papert
Key Events & Terms | Perceptron, Exclusive OR (XOR) Problem, Single-layer Neural Network, First AI Winter, DARPA Funding Withdrawal
Core References
Rosenblatt, F. — The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain (1958)
Minsky, M., & Papert, S. — Perceptrons: An Introduction to Computational Geometry (1969)
III. Symbolic AI and the Expert Systems Era (1970s–1980s)
Key Figures | Edward Feigenbaum, Edward Shortliffe
Key Events & Terms | Expert Systems, Knowledge Engineering, MYCIN, XCON, Fifth Generation Computer Systems Project, Knowledge Acquisition Bottleneck
Core References
Feigenbaum, E. A. — The Art of Artificial Intelligence: Themes and Case Studies of Knowledge Engineering (1977)
Shortliffe, E. H. — Computer-Based Medical Consultations: MYCIN (1976)
IV. Neural Network Persistence and the Second AI Winter (1980s–1990s)
Key Figures | Geoffrey Hinton, David Rumelhart, Ronald Williams, Vladimir Vapnik
Key Events & Terms | Backpropagation, Vanishing Gradient, Statistical Machine Learning, Support Vector Machine (SVM), Second AI Winter
Core References
Rumelhart, D. E., Hinton, G. E., & Williams, R. J. — Learning Representations by Back-Propagating Errors (1986)
V. Deep Learning Revival and the Convolutional Era (2000s–2012)
Key Figures | Geoffrey Hinton, Yann LeCun, Yoshua Bengio, Fei-Fei Li, Alex Krizhevsky
Key Events & Terms | Deep Learning, Convolutional Neural Network (CNN), GPU Parallel Computing, ImageNet, AlexNet
Core References
LeCun, Y., Bottou, L., Bengio, Y., & Haffner, P. — Gradient-Based Learning Applied to Document Recognition (1998)
Krizhevsky, A., Sutskever, I., & Hinton, G. E. — ImageNet Classification with Deep Convolutional Neural Networks (2012)
VI. Transformer and the Large Model Transition (2017–)
Key Figures | Ashish Vaswani, Ilya Sutskever, Tom Brown, Jared Kaplan
Key Events & Terms | Transformer, Attention Mechanism, Large Language Model (LLM), GPT Series Models, Scaling Law, Hallucination, Causal Reasoning
Core References
Vaswani, A. et al. — Attention Is All You Need (2017)
Brown, T. et al. — Language Models are Few-Shot Learners (2020)
Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., ... & Amodei, D. — Scaling Laws for Neural Language Models (2020)
