人工智能模型崩潰(Model Collapse)與資訊生態改變

生成式人工智慧 (Generative Artificial Intelligence) 的快速發展,使大型語言模型 (Large Language Models, LLM) 成為當代知識生成的重要基礎設施。然而,近年的研究指出一個潛在的結構性問題:當 AI 系統逐漸依賴自身生成資料進行再訓練時,模型可能出現資訊退化與性能崩潰的現象,此現象被稱為模型崩潰 (model collapse) [1]。
模型崩潰並非單一工程問題,而是直接的影響了現有的知識生態與資訊多樣性 (information diversity) 等更深層次的議題。
模型崩潰現象 (Model Collapse)
研究進一步指出,若生成模型反覆在自身生成資料上進行訓練,模型性能會逐代下降,最終導致輸出品質顯著退化,這一現象被稱為模型崩潰。模型崩潰的核心特徵包括:語言多樣性下降、輸出逐漸重複化、罕見資訊逐漸消失、模型錯誤累積。形成原因主要來自於生成模型的統計特性。當模型生成內容時,往往更傾向於產生高機率的語言模式。當這些輸出再次被用作訓練資料時,資料分佈將逐漸集中於少數常見模式,導致整體分佈變窄。隨著訓練循環持續進行,原始資料分佈中的長尾資訊 (long-tail information) 可能逐漸消失,使模型失去對罕見或複雜知識的表達能力。
資訊分佈與生態
生成模型的核心目標是學習真實資料分佈 (data distribution),使模型能夠生成與原始資料相似的樣本。對於語言模型而言,訓練過程可理解為對語言分佈的統計近似。在理想情況下,模型透過大量人類生成文本學習語言規律,並生成新的語言樣本。
當生成式 AI 的內容逐漸大量進入網路資料來源時,未來的新模型可能會在訓練過程中吸收大量 AI 生成資料 (AI-generated data),又稱合成資料 (synthetic data)。訓練資料來源逐漸由人類文本轉變為混合來源,人類生成資料與人工智能生成資料形成混合資料 (mixed data)。這種資料來源的改變,將對模型所學習的語言分佈產生重要影響。
在傳統知識體系中,文本的大規模傳播通常伴隨一定程度的編輯制度、同行評審 (peer review) 或出版審查機制。無論是學術論文、書籍出版或專業媒體內容,文本的產生與流通往往經歷知識累積與品質篩選的過程。這些制度在一定程度上維持了知識來源的可靠性與文本品質的基本門檻。
然而,在生成模型參與文本生產的環境中,文本生成的成本與速度均顯著降低。大量內容可以在短時間內被生成並擴散至網路空間,這導致大量無法控管的資訊增長,這種轉變可能重新塑造人類文明對文本知識的使用方式與依賴結構。
應對策略
為避免模型崩潰或是間接汙染到資訊生態,首要任務是維持高品質人類資料來源,例如論文學術的體制審核與精煉結構性質。
由於人類文本仍是最重要的原始資料來源,因此持續收集新的真實文本與知識資料,是維持模型品質的重要條件,這樣的做法不管是對於人類群體維護資訊本身,或是用於生成模型都能確保資料的真實性。
其次是建立資料來源辨識與過濾機制,在未來的資料管線中,區分人類生成資料 (human-generated data) 與 AI 生成資料 (AI-generated data) 可能成為必要步驟。因此在未來的發展中,如何維持資料來源的真實性與多樣性,將成為人工智慧研究與政策治理的重要議題。
參考文獻 (References)
[1] Shumailov, I., Shumaylov, Z., Zhao, Y. et al. AI models collapse when trained on recursively generated data. Nature 631, 755–759 (2024). https://doi.org/10.1038/s41586-024-07566-y

