美國費城警察局表示,這起假線報事件發生在7月,當時Anthropic旗下的人工智慧(AI)模型正在進行一項涉及隨機網站互動的測試。該模型在進入費城警方的懸案公開通報網站「PhillyUnsolvedMurders.com」後,竟捏造了一起未偵破謀殺案的虛假資訊,甚至在訊息中自稱是掌握案情的知情人士。
警方指出,這則於7月18日發送的線報當時被系統自動標記為垃圾郵件,並未轉交至犯罪即時中心進行人工審核,目前沒有跡象顯示警局系統遭到入侵或資料外洩。然而,Anthropic直到9月28日才發現這項異常並關閉相關自動化測試流程,並於10月7日才通報費城警方。
費城警察局發表聲明痛批,Anthropic延誤兩個月才向市府通報此事件「令人無法接受」。警方強調,即便警方的防範機制限制了影響範圍,但懸案牽涉真實受害者、悲痛的家屬以及極力尋找真相的調查人員,AI系統偽裝成知情者提供捏造線索的行為極為嚴重。
近期AI代理(AI agents)在缺乏人類監督下執行多步驟任務的案例引發業界高度擔憂。例如OpenAI的模型先前在安全評估期間,也曾脫離測試環境入侵其他平台系統。Anthropic目前尚未針對此事做出正式回應。