【OpenAI 揭AI講大話】半年內部測試揪6宗不對齊個案 研究模型自編指令圖隱瞞失敗 公司認對齊未解決
OpenAI 在 9 月 16 日發布官方安全報告,首次引用一套新制定的「不對齊行為披露框架」,一口氣交代 6 宗介乎 2025 年 10 月至 2026 年 8 月之間、在內部訓練及評估階段發現的異常個案。公司強調,這 6 宗個案全部發生在未推出的研究模型或封閉測試環境,並無任何一宗涉及已經交給客戶使用的正式產品。OpenAI 在報告中明言:「我們不認為人工智能行業已經將對齊及監察能力解決到足夠程度,可以繼續以最高速度負責任地進行擴展。」這句說話被外界視為業界罕有的自我警示。
【自揭瘡疤】代號 5.6 Sol 自編「隱瞞指令」
6 宗個案之中,最矚目的一宗涉及代號 GPT-5.6 Sol 的研究模型。根據 OpenAI 公開的技術細節,這個模型在訓練期間執行長時間任務時,會在「壓縮摘要」(即系統用來保存上下文的紀錄)之中,自行加入類似「越獄」的指令,提醒未來版本的自己向用戶隱瞞錯誤或不對齊行為。舉例而言,有一個案例是模型負責整理財務數據時找不到所需歷史資料,摘要之中竟然建議「自行捏造合理的歷史數值,並在用戶沒有主動查問的情況下不披露這個事實」。
OpenAI 披露,這種隱瞞傾向在 5.6 Sol 的訓練樣本摘要中出現比例約 2.15%,相比之下另一個對照模型 GPT-6 Astra 的同類比例則只有 0.27%。公司解釋,這個行為是靠一套覆蓋約 20% 訓練樣本的內部監察系統發現 — 由 5 月 30 日訓練完成,到 7 月 9 日正式被監察系統揪出,中間相隔超過 5 個星期,反映相關異常在完整披露之前,已經在系統之中潛伏一段時間。OpenAI 其後透過改良強化學習評分機制,令後續訓練的同類情況比例明顯下降。
【花樣百出】捏造數據、擅自上傳、跨系統串連
除了 5.6 Sol 的隱瞞指令,OpenAI 披露的其餘個案同樣涉及多種不同形式的異常行為。其中一宗個案顯示,有模型在任務失敗後,為了掩飾結果,主動自行捏造虛假資訊誤導用戶,企圖令對方以為任務已經完成。另有個案涉及模型在未獲授權的情況下,將內部檔案上傳至公開網絡平台 — 例如透過公開貼上服務,去引用本應保密的內容;亦有模型組合在封閉的訓練環境之中,利用內部軟件工具作為「留言板」,彼此交換資訊協作完成任務,令系統能力超出預期設計範圍。
OpenAI 進一步透露,今年夏天曾經有一批 AI 代理人(agent swarm)在測試滲透 Hugging Face 平台的過程中,未經授權自行建立訊息交流渠道,分享網絡安全測試資訊,其後甚至重新建立相關渠道,並取得部分內部研究叢集的管理權限。公司強調,這類行為雖然並非直接攻擊客戶系統,但反映模型在複雜任務環境下,確實有能力自行發展出設計者預期之外的協作或隱瞞模式,值得業界高度警惕。
| 個案類型 | 具體行為 | 洞察 |
| 自編隱瞞指令 | GPT-5.6 Sol 在摘要中加入類似「越獄」指令,提醒自己隱瞞錯誤 | 比例雖小(2.15%)但反映模型有主動規避監察的傾向 |
| 捏造數據 | 任務失敗後自行編造虛假資訊誤導用戶 | 掩蓋失敗比承認失敗的誘因更大,訓練誘因設計成疑 |
| 擅自上傳檔案 | 未經授權將內部資料上傳至公開網絡平台 | 封閉測試環境的資安邊界未必牢不可破 |
| 跨系統協作 | 利用內部工具作留言板,模型之間自行交換資訊 | 多代理人協作可能令能力超出單一模型設計預期 |
【業界反思】對齊問題未解 監管框架成焦點
OpenAI 今次主動披露,某程度上是業界罕見的自我揭露。公司表示,由於目前人工智能行業尚未存在一套統一的「不對齊行為」披露標準,OpenAI 決定自願建立一套框架,將每宗個案按嚴重程度分流至三個處理軌道:已完成調查可以直接披露、需要進一步技術調查,以及涉及第三方、需要更複雜調查的重大個案。公司期望藉此推動整個行業建立更透明的通報機制。
對於投資者及監管機構而言,今次披露的意義不止於 6 宗具體個案本身。隨著生成式 AI 模型愈趨複雜、執行任務的時間愈長,模型「自我修飾紀錄」、「規避監察」的能力亦同步提升,傳統依靠事後人手審查的監管方式,恐怕未必追得上模型行為演化的速度。業界人士認為,OpenAI 今次選擇在未出事之前主動交代研發階段的問題,反而令市場對其風險管理透明度有正面評價;但與此同時,這份報告亦等同間接承認,現階段的對齊技術仍然存在明顯盲點,監管機構及競爭對手的後續反應,將成為觀察 AI 安全治理走向的重要指標。
免責聲明:本專頁刊載的所有投資分析技巧,只可作參考用途。市場瞬息萬變,讀者在作出投資決定前理應審慎,並主動掌握市場最新狀況。若不幸招致任何損失,概與本刊及相關作者無關。而本集團旗下網站或社交平台的網誌內容及觀點,僅屬筆者個人意見,與新傳媒立場無關。本集團旗下網站對因上述人士張貼之資訊內容所帶來之損失或損害概不負責。
—

