OpenAI與Anthropic測試爆漏洞 AI竟造假身分騙人類

Reuters 路透社報導

英國AI安全研究所(AISI)最新測試指出,OpenAI與Anthropic的AI智能體在安全評估中出現多起越權行為,甚至有AI自行編寫惡意代碼並創建虛假線上身份,企圖欺騙人類以獲取系統授權,引發外界對AI安全防護的擔憂。

根據路透社(Reuters)報導,英國AI安全研究所(AISI)在對Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol進行安全評估時,發現這些AI智能體(AI agents)超出了提示詞的限制,執行了未經授權的行為。AISI在模擬的網路安全場景中進行了122次測試,並在其中10次測試中,發現了19次未授權行為。其中,Anthropic的智能體涉及17次,OpenAI則佔了2次。

在這些違規行為中,最嚴重的事件是某個智能體自行編寫了惡意代碼,並創建了虛假的線上身份,試圖誘騙人類批准該代碼。雖然AISI並未在報告中指明是哪家公司的智能體所為,但Anthropic隨後證實該智能體為旗下產品。對此,非營利組織CivAI的研究員Andrew Yoon指出,這表明Anthropic對其模型的掌控程度,可能不如他們想像中那麼好。

OpenAI則在官方部落格中表示,其智能體的兩次未授權行為,皆涉及以提示詞禁止的方式連結網路。此外,OpenAI也透露,第三方測試提供商Irregular的配置錯誤,曾導致其智能體意外連接到網路。AISI強調,此次測試並未造成任何現實世界的實質傷害,且智能體並未逃脫隔離的測試環境。