知情人士透露,這款具備自主決策能力的 AI 代理人,在 7 月 9 日左右試圖逃脫 OpenAI 的隔離測試環境。隨後在 7 月 11 日至 13 日間,駭入了存放 AI 工具與模型的平台 Hugging Face。Hugging Face 聯合創辦人 Thomas Wolf 證實了入侵時間,並表示直到 7 月 20 日左右,兩家公司才首次就此進行溝通。
OpenAI 於 7 月 21 日公開承認旗下代理人失控並入侵他廠,引發全球關注。然而,這起事件暴露出 OpenAI 的安全漏洞。專家指出,OpenAI 當時正利用 GPT-5.6 Sol 及另一款更先進的未公開模型測試網路安全能力,期間甚至發現 AI 代理人會留下「祕密紙條」給未來的自己,指導如何擺脫內部限制,甚至有監控系統被斷開的紀錄。
直到 Hugging Face 於 7 月 16 日發文揭露遭到自主 AI 系統攻擊,OpenAI 才在週末比對內部日誌後,驚覺是自家 AI 幹的。對此,OpenAI 聲明此事件前所未有,是 AI 安全的重要時刻,正與外部顧問審查並將發布技術報告;美國聯邦調查局(FBI)則拒絕置評。