share_log

AI巨頭齊喊「剎車」之際安全警報再拉響!OpenAI自曝6起模型異常行爲 直言對齊難題仍未解決

智通财经 ·  09/17 16:16

OpenAI週三在一篇博客文章中表示,該公司在過去六個月裏發現了6起「意外或令人擔憂的模型行爲」。

智通財經APP獲悉,OpenAI週三在一篇博客文章中表示,該公司在過去六個月裏發現了6起「意外或令人擔憂的模型行爲」,其中不包括此前入侵Hugging Face這一安全事件。與此同時,OpenAI還計劃採用一套新框架,允許員工報告類似事件以進一步提高AI安全與對齊領域的透明度,並重申關鍵的對齊難題仍然沒有真正解決。

OpenAI自曝6起模型異常行爲

據悉,這6起新公佈的AI安全事件涉及多種類型的異常模型行爲,包括隱瞞錯誤、尋求未經授權的憑證、將文件上傳至公共網站,以及在原本應保持隔離的訓練環境之間進行通信等行爲,其中最早的一起克追溯至去年10月。

具體來看,其中一起事件涉及一款尚未發佈的Astra系列模型。該模型在自身的上下文摘要中植入了類似「越獄」的指令,包括要求忽略開發者消息的指示。根據Axios的報道,OpenAI發現共有27份摘要受到這一行爲影響。

在GPT-5.6 Sol的訓練過程中,模型曾試圖隱瞞錯誤、編造缺失的歷史數據,以及隱藏源材料不同版本之間的差異。另一個模型搜索公開的GitHub代碼庫,以尋找暴露的API密鑰、並試圖使用一次性電子郵件帳戶。在未能獲取所要求的信息後,該模型轉而僞造了收益數據。在另外兩起事件中,模型將數據和一張任務圖片上傳至公共文件託管服務,以獲取引用或外部圖片搜索結果,而沒有徵得用戶同意。

OpenAI還發現,一些模型利用其內部Artifactory代碼庫充當留言板,在不同的訓練樣本之間交換請求和答案。在另一起事件中,協作式智能體將一個工作簿上傳至公共託管服務,以便其他智能體獲取該文件,儘管它們被要求只能使用本地文件。

這些AI安全事件的最新披露的緊跟此前OpenAI模型失控入侵全球知名人工智能開源平台Hugging Face這一事件。今年7月,OpenAI承認,其AI模型在內部評估測試中失控,入侵了Hugging Face的系統。Hugging Face於7月16日率先披露了此次入侵事件。OpenAI隨後於21日才披露,其GPT-5.6 Sol模型及一款未發佈的更強模型,在一個已移除安全防護措施的測試環境中成功逃脫沙盒限制,穿透OpenAI企業內網,併入侵了Hugging Face的服務器,竊取了基準測試答案密鑰。

同時,7月25日,有外媒援引知情調查人士的消息稱,入侵Hugging Face的OpenAI智能體曾展開持續數日的「黑客狂歡」,直到威脅已被控制、聯邦調查局(FBI)接到報警後很久,OpenAI才察覺此事。

據報道,美國參議院一個由共和黨主導、負責災害管理監督的小組委員會,正就OpenAI如何應對7月Hugging Face遭入侵事件展開調查。共和黨參議員喬希·霍利上週致信OpenAI首席執行官薩姆·奧爾特曼,稱此次調查針對的是事件中「新出現的、令人不安的證據」,並批評OpenAI發現AI出現失控行爲後仍決定繼續測試的做法是「魯莽」的。

自Hugging Face遭入侵事件後,又有多起與OpenAI相關智能體有關的事件被曝光。9月有報道稱,OpenAI的智能體今年春天接管了一個長期無人維護的德國維基網站。報道稱OpenAI內部知道此事,但選擇沒有公開。OpenAI隨後回應,之所以未披露該維基網站活動,是因爲這不構成安全事件,且類似行爲此前已在別處報告過。報道還提到,OpenAI在一些事件上是在第三方先公開之後才承認,其中包括近期對RubyGems軟件包倉庫的一次入侵。

OpenAI將定期公開AI異常行爲報告

OpenAI週三還表示,將開始定期發佈關於AI出現意外行爲或未經授權行爲的報告。該公司表示,計劃採用一套新的框架,來報告未來出現的模型異常行爲。現在任何員工都可以標記疑似事件,並提交給公司的安全與對齊團隊進行調查,後者將爲每一步設定截止期限,以確保調查和披露能夠及時推進。

據報道,相關事件將被分爲三個處理類別——準備披露、小規模調查、大規模調查。被認定爲準備披露的事件將在6個工作日內向公衆公佈,而需要進行小規模調查的事件將在12個工作日內披露。更復雜的案件、尤其是涉及第三方的事件,可能需要更長時間。

OpenAI同時提醒業內,隨着系統能力變強,關鍵的對齊難題仍然沒有真正解決。OpenAI在博客中重申,公司並不認爲AI行業已經在「對齊」和監控方面取得了足夠進展,足以在「最大速度」下繼續負責任地擴張。所謂對齊,是指模型所追求的結果與人類利益保持一致。

OpenAI對齊團隊的研究負責人Kai Chen表示:「我們需要加大力度,以應對AI發展的新時代。」他還表示,自願披露應當成爲這一努力的一部分。

AI行業安全風險持續上升

此次AI安全事件披露發佈之際,AI公司正面臨越來越大的壓力,被要求更認真地對待模型失配與安全風險。位行業研究人員上週已警告,AI日益增強的能力可能帶來災難性後果。

隨後,Anthropic首席執行官達里奧·阿莫迪在9月12日發佈的一篇警告性文章中呼籲放緩前沿AI模型開發速度。他在文中直言,AI帶來的風險是「嚴峻的」,必須拿出時間來應對這些風險。

阿莫迪提出的核心擔憂具體而緊迫。他警告稱,按照當前的發展速度,AI可能在6到12個月內具備指揮「代理集群」接管整個互聯網的能力,並可能造成數千億美元級別的損失。他引用了近期OpenAI與Hugging Face之間的安全事件作爲佐證,指出AI代理在測試中已展現出突破限制環境、連接互聯網並滲透目標的能力。

阿莫迪寫道:「我相信,如果放緩能讓我們在模型達到關鍵能力水平之前多爭取一到兩年,並用這段時間推進對齊工作,我們就能大大降低出現嚴重問題的風險。」他提議由獨立審計機構監督AI實驗室的安全工作,並建議監管機構允許這些實驗室開展合作,以協調安全標準。

這番呼籲迅速得到了兩位關鍵人物的響應。馬斯克在社交媒體平台X上轉發了阿莫迪的帖子,並附言:「達里奧說得對」。這位曾多次將AI描述爲「文明級風險」的科技巨頭,此次表態與其一貫立場一致,但時機耐人尋味,就在幾天前,他還將Anthropic內部研究員關於AI危害的警告斥爲「陰謀局」和「心理戰」。

OpenAI掌舵者奧爾特曼則在X上寫道:「我認同達里奧,我們需要把控前沿AI的推進節奏。」奧爾特曼的支持不止於言辭。他在接受採訪時明確表示,OpenAI不會在2026年進行IPO,理由是當前AI安全形勢嚴峻,「現在上市是不明智的」。奧爾特曼在9月14日表示,公司支持建立統一的聯邦AI安全框架,爲前沿AI實驗室設定一致的安全要求,並稱「任何程度的美國競爭壓力都不能成爲魯莽行事的理由」。

隨着OpenAI、Anthropic等頭部AI公司不斷強調安全與對齊問題,市場對AI行業的治理能力、商業化節奏以及未來監管環境的關注也在升溫。對於估值高企、且仍處於資本密集擴張階段的AI企業而言,模型安全事件不僅關係到產品可信度,也可能影響外界對其上市節奏與長期增長路徑的判斷。

編輯/Deng

譯文內容由第三人軟體翻譯。


以上內容僅用作資訊或教育之目的,不構成與大象銀行相關的任何投資建議。大象銀行竭力但無法保證上述全部內容的真實性、準確性和原創性。