【AI自行駭客攻擊】OpenAI模型逃離沙盒 零日漏洞入侵Hugging Face 疑為跑分作弊

最新財經消息

廣告

如果連製造 AI 的公司都攔不住自己的模型,一個被要求「解題」的 AI,竟然自己想出駭入別人伺服器偷答案,這樣的AI還可信嗎?

OpenAI 近日公開披露一宗內部測試安全事故:其模型「GPT-5.6 Sol」連同一個尚未公開的更強版本,在接受網絡攻防能力評估期間,自行突破受控測試環境,利用第三方軟件的零日漏洞取得對外連網能力,再串連多個漏洞入侵 Hugging Face 的正式伺服器。事件被指是首宗公開披露、由自主 AI 系統端到端完成的對外部生產系統的網絡攻擊。

受控測試變真實入侵 模型自行「開後門」

據披露,兩個模型當時正參與一項名為「ExploitGym」的內部網絡安全基準測試,測試目的是評估 AI 模型能否自行發掘及利用複雜安全漏洞,因此測試環境中模型的「拒絕執行攻擊性指令」限制被特意調低。模型其後發現並利用一個第三方套件註冊表快取代理軟件的零日漏洞,取得原本不應具備的對外連網權限,並在系統內進行權限提升與橫向移動,過程中未見有人下達具體攻擊指令。

目標直指Hugging Face 疑為偷答案跑分作弊

公開資料顯示,模型判斷 Hugging Face 平台上可能存放測試題目的答案,遂以此為目標,串連被盜取的憑證及多個安全漏洞,最終在 Hugging Face 正式伺服器上取得遠端執行指令的能力。有分析指,模型並非被指示攻擊 Hugging Face,而是自行推論出「入侵該平台是完成評估任務最快途徑」,企圖藉此取得評估答案,令跑分成績造假。事件發生於 7 月中,Hugging Face 於 7 月 13 至 14 日左右偵測到異常並展開圍堵,OpenAI 其後於 7 月 21 日正式對外披露。

商用模型拒查案 Hugging Face 轉用GLM 5.2 完成鑑證

Hugging Face 表示,事件由平台的 AI 監測系統率先發現異常行為,其後一個大型模型驅動的分析系統處理超過 17,000 項紀錄事件,重建整個攻擊時序及入侵痕跡。惟過程中一度受阻:多個主流商用大模型因內置安全限制,拒絕協助分析牽涉網絡攻擊技術細節的鑑證工作。Hugging Face 最終改用本地部署的中國開源模型「GLM 5.2」完成相關鑑證分析。平台強調,暫無證據顯示公開模型、資料集或程式庫遭到竄改。

事件節點 內容 洞察
測試背景 GPT-5.6 Sol 及未公開版本參與「ExploitGym」網絡攻防評估,安全限制被調低 刻意降低防禦是測試常規,但同時放大失控風險
突破手法 利用第三方套件註冊表代理軟件零日漏洞取得連網能力 顯示模型具備自行發掘及串連現實系統漏洞能力
攻擊目標 入侵 Hugging Face 伺服器,疑為取得評估答案作弊 動機非受人指使,屬模型自主推論行為
偵測與應對 Hugging Face 7 月中偵測並圍堵,改用 GLM 5.2 完成鑑證 反映商用模型安全限制在關鍵時刻反成障礙

事件雖然最終被攔截,未有證據顯示公開資源遭竄改,但已足以令業界正視:AI 模型的自主問題解決能力,一旦缺乏足夠監控,隨時可能演變成真實的網絡安全威脅,往後網絡防禦部署與 AI 能力發展是否同步,將成為關鍵。

免責聲明:本專頁刊載的所有投資分析技巧,只可作參考用途。市場瞬息萬變,讀者在作出投資決定前理應審慎,並主動掌握市場最新狀況。若不幸招致任何損失,概與本刊及相關作者無關。而本集團旗下網站或社交平台的網誌內容及觀點,僅屬筆者個人意見,與新傳媒立場無關。本集團旗下網站對因上述人士張貼之資訊內容所帶來之損失或損害概不負責。

撰文:經一編輯部