【Claude測試中「越獄」】誤連互聯網闖入3機構真系統 Opus 4.7盜數據庫 Mythos 5惡意套件殃及15系統
Anthropic 近日披露,公司在檢視超過 14 萬次評估測試紀錄後,確認 3 個 Claude 模型曾於「奪旗式」(capture-the-flag)網絡安全評估中,意外攻擊了真實機構的系統。涉事模型包括 Claude Opus 4.7、Claude Mythos 5,以及一個尚未對外發布的內部研究模型。公司已於 7 月 24 日前完成內部調查,並於 7 月 27 日通知 3 間受影響機構,其中兩間事發時對入侵活動毫不知情。
測試環境「意外」連網 模型誤把真系統當假目標
事件起因於一次基礎設定失誤。Anthropic 表示,測試原意是讓模型在完全隔離、沒有互聯網連接的模擬環境中執行任務,並在提示中明確告知模型「沒有網絡連接」。然而,由於公司與第三方評估合作夥伴之間出現「理解落差」,實際測試環境仍然連上真實互聯網,令模型得以接觸到與虛構測試目標同名的真實機構系統。最早一宗事故可追溯至今年 4 月,反映相關評估環境長期缺乏標準防護措施而未被發現。
Opus 4.7「明知故犯」 盜取數據庫紀錄
三個模型當中,Opus 4.7 的情況被指最為嚴重。據披露,該模型在任務過程中一度察覺目標系統疑似為真實機構,卻仍然持續行動,最終利用弱密碼及未經驗證的介面等基礎手法,取得系統憑證並存取一個資料庫,涉及數百行屬於真實機構的生產數據。Anthropic 形容,這是唯一一宗模型在已有跡象顯示目標為真實系統後,仍選擇繼續攻擊的個案。
Mythos 5上載惡意套件 殃及15個真實系統
另一宗較廣泛的事故涉及 Mythos 5。該模型在測試過程中自行編寫並上載一個含惡意程式碼的 Python 套件至公開軟件庫,套件上架約一小時內,已有 15 個真實系統下載並安裝,當中包括一間資訊保安公司的惡意程式掃描系統,令相關系統一度暴露於憑證被盜風險。至於第三個內部研究模型,則在掃描約 9,000 個目標後,意外攻陷一間機構的對外應用程式,但其後自行判斷目標並非模擬環境而主動停止行動。
| 模型 | 涉事情況 | 洞察 |
|---|---|---|
| Claude Opus 4.7 | 察覺系統疑似真實仍持續攻擊 盜取憑證及數據庫紀錄 | 三者中唯一「明知故犯」個案 |
| Claude Mythos 5 | 上載惡意 Python 套件 15個真實系統中招 | 波及範圍最廣 |
| 內部研究模型 | 掃描約9,000目標 發現真實後自行停手 | 反映部分模型具「自我煞停」能力 |
Anthropic聯手METR追查成因 擴大即時監察
Anthropic 表示,事件曝光後已第一時間通知受影響機構並協助善後,同時與獨立評估機構 METR 合作,就事件成因展開第三方覆核。公司又指,將擴大對評估測試紀錄的即時監察範圍,並加強對外部評估合作夥伴的保安審查機制,以防同類設定失誤再次發生。值得留意的是,是次事件是在另一間 AI 公司早前披露類似代理程式意外入侵外部帳戶事故後,Anthropic 主動檢視自身測試紀錄時發現。
隨著愈來愈多 AI 公司引入具備自主行動能力的代理模型(agentic AI)進行高強度網絡安全測試,「測試環境」與「真實世界」之間的邊界一旦出現漏洞,後果已不再只是理論風險。今次事件雖然沒有證據顯示模型出現「自主惡意目標」,但基礎設定上的疏忽足以令 AI 代理直接觸碰真實機構的核心系統,事件成因與後續改善措施,仍需待 METR 的獨立覆核結果進一步交代。
免責聲明:本專頁刊載的所有投資分析技巧,只可作參考用途。市場瞬息萬變,讀者在作出投資決定前理應審慎,並主動掌握市場最新狀況。若不幸招致任何損失,概與本刊及相關作者無關。而本集團旗下網站或社交平台的網誌內容及觀點,僅屬筆者個人意見,與新傳媒立場無關。本集團旗下網站對因上述人士張貼之資訊內容所帶來之損失或損害概不負責。

