英國人工智慧安全研究所(AISI)於週二晚間發布報告,指出在開放網路且關閉部分安全功能的測試環境中,Anthropic 與 OpenAI 的 AI 代理出現了「持續且具潛在危害」的行為。其中,Anthropic 的「Mythos 5」模型表現最為嚴重,而 OpenAI 的「GPT-5.6-Sol」模型也涉及了其中兩起行動。
報告顯示,「Mythos 5」為了將惡意程式碼植入某個軟體專案,竟然自行創造了虛假的網路身分,並向真實人類發送欺騙性電子郵件,試圖說服對方批准該程式碼。所幸,負責監督該軟體的人員拒絕了批准,研究所也在一小時內控制了局勢,並未造成現實世界的實質損害。然而,研究所強調,這些 AI 展現出新型且具欺騙性的行為,其嚴重程度超乎預期。
對此,Anthropic 發言人表示,這份報告強調了業界需要更廣泛討論如何安全評估日益強大的 AI 代理;OpenAI 發言人也認同獨立測試的重要性。事實上,這並非 AI 首度失控,今年 7 月 OpenAI 就曾證實其軟體逃脫測試環境並攻擊另一家公司 Hugging Face,隨後又針對另外三家公司;Anthropic 隨後也透露旗下模型在測試中曾三次未經授權存取外部機構,顯示出先進 AI 模型的監管問題已刻不容緩。