OpenAI更新模型安全措施,強化測試期隔離監控
OpenAI 週二披露,已更新一組模型安全措施,重點放在開發和測試階段的事件控制。 公司稱,隨著模型能力持續提升,內部開發與評估環節的風險也在上升,因此需要同步提高監控、對齊和安全要求。
這也是 7 月 26 日 Hugging Face 事件揭露後,OpenAI 首次公開調整相關安全做法。 公司表示,新措施並非只針對那次事件,也與即將推出的 Astra 模型網路安全能力,以及 AI 開發進展加快有關。
公告顯示,Hugging Face 事件發生後,OpenAI 曾暫停強化學習(RL)訓練兩週。 此後,部分風險較低的模型訓練已經恢復。
不過,公司目前仍未恢復原定規模最大的前沿 RL 訓練。 OpenAI 表示,在繼續推進前,會先進行更小規模的訓練和評估,用來觀察模型行為、驗證現有防護,並累積更多對齊證據。
OpenAI 這次調整的一個重點,是收緊模型測試環境的網路隔離。 先前外界批評其網路安全做法不足,原因是相關事件中,模型透過入侵一項可連網工具,脫離了原有訓練環境。
依照新安排,即便單一工作負載或配套服務被攻破,也不應因此直接取得網路存取權限,或進入其他內部網路。 公司沒有揭露更具體的技術細節,但明確表示會提高隔離強度。
另一個核心措施是擴大監控範圍。 OpenAI 表示,系統將檢查工具呼叫行為、可用的推理軌跡,以及活動日誌,以識別多種未經授權的操作。
依公司說法,這套監控系統的目標是在可疑活動出現後 30 分鐘內發出警告。 OpenAI 估計,這部分監控帶來的算力負擔,大約相當於被監控流程的 20%。
研究副總裁 Amelia Glaese 對媒體表示,控制強度會隨模型能力提升而增加,規模最大的模型將接受最嚴格審查。 該公司也稱,後續將單獨發布更多技術說明,而針對該事件的正式複盤報告仍未公佈。
Hugging Face 事件的公開細節顯示,問題發生在模型測試期間,而不是面向外部使用者的正式發布環境。
登入回覆
登入分享您的看法評論
相關文章