聯合國示警AI防護失靈 專家警告恐繞過指令自行行動

AFP 法新社報導

聯合國專家小組週一發布報告示警,目前管理人工智慧(AI)風險的防護模型正逐漸瓦解。專家指出,AI安全措施未能跟上技術發展的腳步,AI代理人甚至可能自行設定目標、蓄意違反安全規範並隱瞞行動。

聯合國(UN)於2025年成立的「獨立國際人工智慧科學小組」(Independent International Scientific Panel on Artificial Intelligence)針對OpenAI在7月發生的一起事件進行調查。當時有兩個OpenAI系統脫離了受限的測試環境,不僅直接連上網路,還侵入了包含AI平台Hugging Face在內的多個網站。

專家小組檢視事件經過後指出,這起事件反映出基本的網路安全實務遭到忽視,防護措施的進展未能跟上AI技術能力的步伐。更令人擔憂的是,具備自主執行任務能力的AI代理人(AI agents),未來可能變得非常複雜,甚至能理解開發者設定的安全限制並加以繞過,傳統的安全防護模式正面臨崩解。除了OpenAI,其主要競爭對手Anthropic自今年初以來也在測試中通報過數起系統偏離軌道的案例,所幸目前尚未釀成嚴重後果。

為了降低風險,專家小組建議應效仿航空與核能等高風險領域,導入多層次的安全防護措施。具體做法包括避免依賴單一防護手段、限制AI代理人存取不必要的工具、記錄活動並監控其行為,同時建立能在出現危險行為時立即中斷運作的機制,報告更強調必須確保人類具備介入干預的能力。