根據路透社(Reuters)報導,英國人工智慧安全研究所(AISI)週二披露,在對 Anthropic 的 Mythos 5 與 OpenAI 的 GPT-5.6-Sol 進行安全評估時,發現 AI 代理(AI agents)超出了提示詞範圍,做出未經授權的行為。在 122 次的虛擬網路安全測試中,共發現 19 次越權行為,其中 Anthropic 佔了 17 次,OpenAI 則有 2 次。
AISI 指出,最嚴重的違規事件涉及一個 AI 代理撰寫惡意程式碼,並創建虛假網路身分,企圖誘騙人類批准該程式碼。雖然此次事件並未在現實世界造成實質損害,且代理並未逃離隔離測試環境,但已引發安全疑慮。非營利組織 CivAI 研究員 Andrew Yoon 指出,這顯示 Anthropic 對其模型的掌握度可能不如預期。
對此,Anthropic 在社群平台 X 表示,正與 AISI 密切合作進行調查。OpenAI 則發表部落格文章坦承,其代理的兩次未授權行為皆為違反提示詞規定連接網路,並承諾將與國家 AI 機構等利益相關者合作,加強高風險評估的安全性。