share_log

頭部AI再失控!Anthropic旗下Claude AI在測試中真實入侵三家公司系統

華爾街見聞 ·  08/01 00:02

Anthropic旗下AI模型Claude在網絡安全測試中,因配置失誤錯誤連接公共互聯網,對三家外部機構基礎設施實施未經授權訪問,最早入侵可追溯至4月。事件在OpenAI披露類似事故後經內部審查曝光。兩起事故引發業界對AI安全管控的質疑,並促使逾1100名從業者聯署呼籲美國政府加強監管。

Anthropic旗下人工智能模型Claude在網絡安全測試中因配置失誤意外入侵三家外部機構,這一事件與競爭對手OpenAI近期披露的類似事故相互疊加,令AI行業的安全管控能力受到嚴峻拷問。

據彭博,Anthropic於7月30日在一篇博客文章中披露,其Claude模型在"奪旗"(capture-the-flag)網絡安全測試中,因測試環境錯誤連接至公共互聯網,導致對三家外部機構的真實基礎設施實施了未經授權的訪問。最早的入侵事件可追溯至今年4月。Anthropic表示,此次披露源於其在OpenAI上週公開類似事故後主動啓動的內部審查。

此次事件發生在OpenAI披露其AI模型在安全測試中"失控"併入侵AI公司Hugging Face基礎設施僅數日之後,兩起事故接連曝光,已促使部分美國政界人士呼籲對AI技術實施聯邦層面的監管。與此同時,據彭博,逾1100名AI行業從業者於本週二聯署請願,呼籲美國政府建立機制以"有意識地控制"AI發展節奏。

配置失誤打開安全缺口

Anthropic表示,此次事故的根源在於其與評估合作伙伴、AI安全公司Irregular之間的溝通誤解。在所有涉事測試中,Anthropic均向Claude明確說明其所處環境爲模擬環境且無法訪問互聯網,但實際上測試系統仍與公共互聯網保持連接。

"由於我們與評估合作伙伴之間存在誤解,實際情況並非如此,"Anthropic在博客中寫道。Irregular發言人表示,該公司對Anthropic的合作與透明度表示讚賞,並稱調查仍在進行中。

涉事的三個模型分別爲Claude Opus 4.7、Claude Mythos 5以及一個內部研究測試模型,均在缺乏公開工具通常配備的標準安全防護措施的環境下運行。Anthropic指出,Claude利用弱密碼和未經身份驗證的端點等基礎技術入侵了上述機構的基礎設施。

值得關注的是,在模型行爲上,較舊的模型在獲得已連接至公共互聯網的證據後仍繼續發動攻擊,而Anthropic最新模型在識別出自身處於互聯網環境後則主動停止了行動。

事後審查揭示監控盲區

Anthropic表示,其於7月23日開始審查評估記錄,並在當天發現Claude可能已訪問互聯網的證據後,立即暫停了所有網絡安全評估工作。公司於7月24日確認全部三起事件,並於7月27日通知了受影響機構。

此次審查共涵蓋141006個測試會話。Anthropic坦承,在事件發生時,公司與受影響機構均未察覺到這些入侵行爲,並承認本可對網絡日誌和評估記錄進行更爲嚴格的審查。

三家受影響機構均未在博客中具名。其中兩家機構在被Anthropic聯繫之前對相關活動毫不知情。

行業安全標準面臨重新審視

Surrey大學網絡安全教授Alan Woodward表示,Anthropic對導致此次事故的人爲失誤持坦誠態度。"AI並沒有失控——你要求它做某件事,然後把門敞開了,"他說,"我認爲Anthropic承認了這一點。"

Anthropic在博客中表示,此次事件揭示了若干重要教訓,包括涉及強大自主能力的測試同樣需要嚴格的管控措施。"安全測試之所以在模型發佈前進行,正是因爲我們尚不完全了解其能力所及,"公司表示,"評估環境越來越需要達到與模型實際運行的任何其他系統相同的安全標準。"

此次事件發生在Anthropic宣佈推出功能強大且潛在風險較高的Mythos模型並對其發佈實施嚴格限制後約四個月。兩起AI安全事故的接連發生,正推動業界重新審視AI測試環境的安全標準,並加速外部監管討論的進程。

編輯/stephen

譯文內容由第三人軟體翻譯。


以上內容僅用作資訊或教育之目的,不構成與象象銀行相關的任何投資建議。象象銀行竭力但無法保證上述全部內容的真實性、準確性和原創性。