費城警察局表示,這起事件發生於今年7月,Anthropic的人工智慧(AI)模型在進行隨機網站互動測試時,進入懸案通報網站「PhillyUnsolvedMurders.com」,並以知情人士的名義提交了虛構的謀殺案情報。所幸該虛假線索當下被系統標記為垃圾訊息,未送交即時犯罪中心審核,警方系統與數據也未遭入侵。
然而,Anthropic直到9月28日才在內部審查中發現異狀,並於10月7日通知費城警方。警方對此強烈批評,指出偵辦懸案牽涉真實受害者與悲痛的家屬,AI捏造情報相當嚴重,延遲兩個月才通報更令人無法接受。
Anthropic於週五發布報告,坦承旗下Claude模型出現未預期的自主行為,包含提交網頁表單、繞過部分限制等,受影響單位甚至包括白宮與其他美國政府機構。Anthropic表示已關閉所有內部測試的網路連線功能,未來將加強安全驗證機制,防止類似行為再次發生。