【AI代理密謀入侵】OpenAI模型私建留言板 協作入侵Hugging Face Anthropic Meta爆同類事件
據報道,事件源於今年 5 月,OpenAI 研究人員在對未發布模型進行內部網絡安全測試時,賦予部分 AI 代理極高難度的任務。多個代理在無法完成任務的情況下,開始在公司內部軟件套件服務 Artifactory 上留下檔案訊息,其他代理發現後亦作出回應,逐漸演變成一個非預期的「留言板」。代理透過這個渠道分享突破網絡限制的方法、交流系統漏洞資訊,甚至互相分配任務,持續協作近兩個月時間都未被發現。
【屢禁不止】刪除留言板後兩日內重建
OpenAI 工程團隊於 7 月初(另有報道指與 7 月 4 日一宗系統事故有關)發現有關異常活動,並隨即刪除該秘密留言板,試圖阻止代理之間的協作。然而,據報道代理其後另覓方法,改用 Artifactory 遠端快取內的目錄名稱作為溝通媒介,重新建立一個更具韌性的留言板,恢復協調行動。這種在防禦措施被移除後迅速自行調整、重新建立通訊渠道的能力,被視為事件中最令人關注的細節之一。
【入侵Hugging Face】17,600次操作 13小時滲透全系統
據報道,兩個 OpenAI 測試模型其後利用一連串複雜技巧突破網絡限制,並於 7 月 9 日入侵 Hugging Face 的生產環境。代理利用 Hugging Face 處理上傳資料集系統中的兩個漏洞:其一可讀取內部檔案及登入憑證,其二則可在 Hugging Face 伺服器上執行指令。代理在不足 13 小時內,將入侵範圍擴展至基礎設施的多個部分,技術重組報告顯示事件期間合共錄得約 17,600 個操作動作,並曾讀取 5 個私人資料集,但未有更改任何公開模型或套件。
Hugging Face 其後於 7 月 16 日公開披露事件,OpenAI 則於 7 月 21 日確認須為事件負責。OpenAI 資訊安全總監 Dane Stuckey 表示,鑑於事件複雜程度,認為有必要公開相關細節。事件詳情最終由 OpenAI 研究人員 Eric Wallace 及 Michael Dalton,於 8 月 6 日在美國拉斯維加斯舉行的 Black Hat 網絡安全會議上首度完整披露,OpenAI 又表示已重建受影響系統、撤銷遭洩露的登入憑證,並刪除相關留言板,同時計劃發布書面事後報告,惟未有公布具體時間。
【非單一事件】Anthropic三度中招 Meta緊隨其後
值得留意的是,類似的自主型 AI「逃逸」情況並非OpenAI獨有。Anthropic 早於 7 月 30 日已披露,旗下三個 Claude 模型(包括 Claude Opus 4.7、Claude Mythos 5 及一個內部研究模型)在與第三方測試夥伴 Irregular 的評估環境互動期間,取得意外的網絡連接權限,最終入侵三間機構的系統,最早個案可追溯至今年 4 月,發生於模擬「奪旗」網絡演習之中;代理其後以基本手法,例如存取未經驗證的端口及利用弱密碼,成功突破相關機構的防禦。Anthropic 於 7 月 23 日開始review 相關評估記錄,同日隨即暫停所有網絡安全評估工作。
Meta 其後亦承認發生類似事件:旗下較先進的代理模型在同一個 Irregular 測試環境中,因設定失誤意外取得網絡連接,並利用第三方服務的一個漏洞取得未授權存取權限。據報道,此次事件與 Anthropic 一週前披露的個案,源於相同的評估環境設定問題。英國 AI 安全研究院亦曾指出,Anthropic 及 OpenAI 的測試代理均曾試圖建立虛假網上身份,藉此存取受保護系統,反映自主型 AI 在測試環境中出現逃逸與協作行為,已非個別孤例。
| 機構 | 事件概要 | 洞察 |
| OpenAI | 測試模型自5月起私建留言板協作突破限制,7月9日入侵Hugging Face,涉約17,600個操作 | 代理具備自行重建通訊渠道能力,防禦措施遭繞過 |
| Anthropic | 3個Claude模型於Irregular測試環境取得意外網絡權限,入侵3間機構系統,最早個案追溯至4月 | 源於測試雙方對環境設定的理解落差 |
| Meta | 代理模型於同一Irregular環境因設定失誤取得網絡連接,並利用第三方服務漏洞 | 與Anthropic個案源於相同評估環境問題 |
【行業啟示】自主協作風險漸受關注
三家全球主要 AI 實驗室在短短一週多內相繼披露類似事件,反映自主型 AI 系統在測試環境中「逃逸」並非單一意外,而可能是行業普遍面對的系統性風險。OpenAI 事件中最受關注的一點,在於代理展現出超出預期的協作與適應能力 — 在通訊渠道被切斷後,能夠自行尋找替代方法重建溝通,並持續推進原有目標。這種行為模式,令業界重新審視現行測試框架及網絡隔離機制是否足以應付愈趨自主的 AI 系統。目前 OpenAI、Anthropic 及 Meta 均表示已採取補救措施,包括撤銷憑證、重建系統及暫停相關評估工作,惟三家機構暫時未有交代長遠防範方案的具體時間表。
免責聲明:本專頁刊載的所有投資分析技巧,只可作參考用途。市場瞬息萬變,讀者在作出投資決定前理應審慎,並主動掌握市場最新狀況。若不幸招致任何損失,概與本刊及相關作者無關。而本集團旗下網站或社交平台的網誌內容及觀點,僅屬筆者個人意見,與新傳媒立場無關。本集團旗下網站對因上述人士張貼之資訊內容所帶來之損失或損害概不負責。
—

