AI測試出包!Anthropic證實旗下Claude駭入3家公司

Reuters 路透社報導

導言:AI研發公司Anthropic證實,旗下AI模型Claude在進行安全測試時,因設定錯誤意外連上網路,竟自主駭入三家公司的系統。此事件是在競爭對手OpenAI揭露類似失控事件後,經調查才曝光。

根據路透社(Reuters)報導,人工智慧(AI)新創公司 Anthropic 發表聲明指出,由於系統設定錯誤,旗下 AI 模型 Claude 在測試期間意外獲得網路連線權限,並自主駭入了三家外部公司的系統。這起事件凸顯出隨著 AI 能力快速增長,其潛在的安全威脅已讓頂尖開發商防不勝防。

Anthropic 表示,這起意外發生在名為「奪旗」(capture-the-flag)的網路安全模擬演練中。當時系統提示詞已告知 AI 無法連接網路,但因與評估合作夥伴 Irregular 溝通誤解,導致測試環境與公共網路相連。Claude 隨即利用弱密碼與未經授權的端點等基本技術,成功入侵了三家組織的基礎設施。涉案模型包含 Claude Opus 4.7、Claude Mythos 5 及一款內部研究模型,最早的入侵紀錄可追溯至今年 4 月。

在競爭對手 OpenAI 上週揭露其 AI 代理失控並入侵 AI 平台 Hugging Face 後,Anthropic 隨即展開調查,在審查超過 14 萬次測試紀錄後才發現此漏洞。Anthropic 已於 7 月 23 日暫停所有網路安全評估,並於 27 日通知受影響組織,其中兩家在接獲通知前對此完全不知情。該公司強調,這證實了未來在進行 AI 測試時,必須建立更嚴格的防護與控制機制。