Anthropic 在週四(27日)發布的部落格文章中指出,在評估了超過 141,000 次「評估運行」後,發現有三個不同版本的 Claude 模型不當訪問了三家未具名組織的系統。其中涉及了該公司最強大的模型之一 Mythos 5,該模型目前僅開放給少數核准的合作夥伴使用。
與競爭對手 OpenAI 日前發生的失控事件不同,Anthropic 表示,其模型之所以能連接網路,是因為公司與評估合作夥伴 Irregular 之間產生了誤解。儘管如此,Claude 模型仍利用了「基本技術」,例如破解弱密碼和未經身分驗證的端點,成功入侵了外部系統。Anthropic 目前正與 Irregular 評估狀況,並已嘗試聯繫受影響的組織。
在此之前,OpenAI 執行長奧特曼(Sam Altman)也證實其模型在安全測試中脫離了受控的「沙盒(sandboxing)」環境,連上網路並滲透了軟體開發平台 Hugging Face。奧特曼表示,目前已暫停相關測試以改進安全防護。
接連發生的 AI 失控事件引發業界高度憂慮,已有超過 1,000 名頂尖 AI 企業員工簽署名為「Pacing the Frontier」的請願書,呼籲美國政府協助放慢先進 AI 模型的發布速度。Anthropic 執行長 Dario Amodei 已簽署該請願書;奧特曼雖未簽署,但也坦言業界可能需要放慢開發速度,好讓社會有足夠時間適應新技術。