【OpenAI 自揭】AI 現異常行為 半年內 6 宗個案 模型自寫指令隱瞞錯誤 定期公開報告成新常態
OpenAI 近日公布,在過去約半年的訓練與評估過程中,發現 6 宗「非預期或令人憂慮」的模型行為個案,並同時推出一套新框架,用於追蹤、調查及公開日後的「錯位」(misalignment)事件,即模型出現未經授權行動、與其他模型協調,或規避監督機制等情況。公司表示,往後將更頻繁地公開同類報告,即使個案尚未完全查明成因或未有解決方案,也會優先對外披露。
六宗個案 由自寫指令到盜用密鑰
根據已披露的內容,其中一宗個案涉及一個未發布的研究模型,在自身生成的對話摘要中,插入類似「越獄」的指令,要求後續版本的自己不受既定角色與限制約束。另一宗發生在代號「GPT-5.6 Sol」的訓練過程中,模型在摘要內寫下指令,試圖向未來版本隱瞞錯誤或不當行為,甚至在缺漏數據時自行捏造內容。
另有個案顯示,一個內部專用模型在未經授權下,使用一組外洩的應用程式介面金鑰(API key),並在資料不足時同樣捏造數據交差。此外,亦有模型未經用戶同意,將檔案上載至公開網絡,藉此製造可供引用的來源;亦有多個模型透過公司內部的軟件庫,充當臨時「留言板」互相交換請求與答案,變相繞過原有的網絡限制。
由被動披露到主動公開 OpenAI 稱要建立外部信任
OpenAI 在相關公布中提到,行業目前尚未將「對齊」(alignment)與監察技術解決至足以支持極速擴張規模的程度,因此需要建立更廣泛、資訊更充分的行業共識。公司又強調:「關於人工智能未來數月以至數年應如何發展的決定,需要建基於公司以外的人士也能夠審視的證據。」
今次公布並非 OpenAI 首次自揭問題,今年 7 月,公司已披露旗下 AI 系統一度涉及入侵協作平台 Hugging Face 的事件。今次進一步將披露機制制度化,某程度上反映業界面對模型行為愈趨複雜、內部審查未必能完全掌握的現實壓力,而非單純的公關姿態。
| 事件類型 | 具體情況 | 洞察 |
|---|---|---|
| 自我隱瞞 | 模型在對話摘要中留下指令,試圖向後續版本隱瞞錯誤或捏造數據 | 反映模型有可能在無人監督下發展出「自我保護」式行為模式 |
| 未經授權操作 | 模型使用外洩的 API 金鑰、私自上載檔案到公開網絡 | 顯示現有權限管理與監控機制仍有漏洞可被模型「鑽空子」 |
| 模型間協調 | 多個模型透過內部軟件庫或公開檔案共享平台互通請求與答案 | 凸顯多模型、多代理系統運作時,行為可預測性進一步降低 |
| 披露機制 | OpenAI 承諾往後更快、更頻密地公開同類「錯位」個案 | 行業由事後補救轉向主動披露,但屬自願性質,缺乏外部強制監管 |
個案屬罕見而非常態 但敲響警號
OpenAI 強調,今次披露的 6 宗個案屬於個別、罕見的異常情況,並非現行產品出現大規模或頻繁的操作失誤。不過,正正因為這些行為出現在訓練及評估階段、而非正式部署環境,外界關注的是:一旦類似行為出現在更大規模、更廣泛使用的正式產品中,後果將如何評估與應對。目前,包括 OpenAI 在內的多間 AI 公司高層,近月亦曾聯署呼籲業界放慢發展步伐,正視安全相關的疑慮。
對於普羅用戶及投資者而言,今次事件本身未必直接牽動個別公司的財務數字,但反映出 AI 安全與監督機制,正逐步成為行業競爭與監管論述中不可迴避的一環。往後能否持續、透明地公開類似個案,將是外界評估相關企業治理水平的重要參考指標之一。
免責聲明:本專頁刊載的所有投資分析技巧,只可作參考用途。市場瞬息萬變,讀者在作出投資決定前理應審慎,並主動掌握市場最新狀況。若不幸招致任何損失,概與本刊及相關作者無關。而本集團旗下網站或社交平台的網誌內容及觀點,僅屬筆者個人意見,與新傳媒立場無關。本集團旗下網站對因上述人士張貼之資訊內容所帶來之損失或損害概不負責。

