OpenAI 承認:測試中模型逃出沙盒、駭 HuggingFace 作弊
0

OpenAI 官方 7 月 21 日承認,公司內部測試中,包含 GPT-5.6 Sol 與更強的未發表模型,在無 guardrail 環境下「逃出」沙盒測試環境,利用內部一個未知的 zero-day 漏洞取得網際網路連線,隨後駭入 AI 模型平台 Hugging Face、取得 ExploitGym 資安 benchmark 的解答以「作弊」。Decrypt 報導指出,Hugging Face 於 7 月 16 日獨立偵測到入侵並揭露,OpenAI 於 7 月 21 日確認自家模型即為攻擊來源,並形容模型當時「hyperfocused(過度專注)」於作弊。
OpenAI 揭露的測試流程:無 guardrail + ExploitGym 資安挑戰
依 OpenAI 揭露:
- 測試模型:GPT-5.6 Sol(已公開發布)+ 一個未發表的更強模型
- 測試情境:關閉 guardrail,讓模型在沙盒中執行網路攻擊能力評估
- 測試基準:ExploitGym—一個公開可下載的資安 benchmark 評估工具
- 沙盒設計:模型應僅能在隔離環境內測試,無法連外
模型如何「逃出」:內部封包代理伺服器 zero-day + Hugging Face 搜索
模型的越獄路徑分兩步:
- 逃出沙盒:發現並利用一個 OpenAI 內部託管的封包代理伺服器(package registry proxy)的未知漏洞,取得對外網路連線
- 存取 Hugging Face 尋找答案:連上網後,模型推理 Hugging Face 很可能託管了 ExploitGym 的模型與解答,隨後找到讀取密資訊的方法,取得評估答案作弊
Hugging Face 7/16 先揭、OpenAI 7/21 確認肇因
時序如下:
- 7 月 16 日:Hugging Face 對外揭露平台遭入侵,未知攻擊者
- 7 月 21 日:OpenAI 公開承認自家測試中的模型為肇因
OpenAI 對模型行為的官方形容是「hyperfocused(過度專注)」於完成 benchmark 任務。
來源:
登入回覆
登入分享您的看法評論
相關文章