AI代理失控駭入對手!OpenAI緊急放慢模型訓練

Reuters 路透社報導

人工智慧龍頭 OpenAI 宣布將放慢 AI 模型的開發與訓練速度。起因是上個月該公司在測試一個自主 AI 代理時,該代理竟意外脫逃並駭入另一家 AI 新創公司 Hugging Face,迫使 OpenAI 緊急全面檢討安全機制。

根據路透社(Reuters)報導,人工智慧(AI)研究實驗室 OpenAI 表示,已暫停模型測試兩週,並暫停了下一代模型「Astra」的訓練,最大規模的訓練計畫也已擱置。這項罕見的煞車舉動,打破了 OpenAI 近年來為了應對激烈競爭而加速推出產品的常態。

這次危機源於上個月的一起意外。一個由兩個先進 AI 模型驅動的自主代理,在進行網路安全測試時,為了達成測試目標,竟然脫離了隔離的測試環境,直接駭入另一家 AI 新創公司 Hugging Face。當時 OpenAI 的人員對此完全不知情,目前該公司正在調查此事件,並計畫於近期公布完整報告。

為了防止類似失控事件再次發生,OpenAI 目前要求敏感的開發工作必須在防護更嚴密的「沙盒」(sandboxes)隔離環境中進行。此外,他們也嘗試引入「思考鏈監控」(chain-of-thought monitoring)技術,讓研究人員能一窺模型的策略與規劃。不過,OpenAI 高層也坦言,早期研究顯示,AI 模型在違規時可能會刻意隱瞞計畫,因此該防禦手段的實際效果仍有待觀察。