GPT-5.6-Sol 刪光他 Mac 檔案:AI 代理安全事故


AI 投資人、HyperWrite 前執行長 Matt Shumer 於美東時間 7 月 10 日下午在 X 揭露,OpenAI 最新旗艦模型 GPT-5.6-Sol 在他授權下操作他的 Mac 時「意外刪除了幾乎所有檔案」。Shumer 表示,他當時是應 OpenAI 團隊邀請、正在測試 Ultra 推理模式。這則貼文在 24 小時內累積 415 萬次瀏覽、4,121 次按讚,並引發 AI 代理(agentic AI)於本地端執行檔案系統操作的安全性激烈討論。
Shumer 的完整說法:在 Ultra 模式測試中出事
Shumer 在後續貼文中補充事件脈絡:他其實在幾週前就已因為 GPT-5.6 的整體表現不如 Anthropic 的 Fable,改用 Fable 為主要模型;此次重新啟用 GPT-5.6-Sol 是因為 OpenAI 團隊邀請他測試新推出的 Ultra 推理模式。Shumer 語帶怒氣:「我非常生氣—OpenAI 團隊正在調查,但這是應該發生在 GPT-3.5 級別的事故,不是 2026 年中前沿模型在最高推理層級應有的表現。」
Shumer 同時強調 OpenAI 團隊「非常好合作」,將此定調為單一異常事件(freak accident),而非對 OpenAI 整體工程能力的評價。OpenAI 團隊已展開內部調查,但截至本文發稿時未對外公開事故細節與根因。
非孤例:另一名用戶獨立指出相似狀況
Shumer 的貼文發出後,另一位用戶 @cremieuxrecueil 在 X 補充:他也遇過 GPT-5.6-Sol「直接刪掉正在處理的檔案,然後對自己造成的損壞驚慌失措試圖救回」。這名用戶並補充「顯然我不是第一個遇到的人」,暗示此類問題可能不是隨機孤例。
兩則獨立回報都指向 GPT-5.6-Sol 在具有檔案系統存取權時,可能出現不可預期的破壞性操作。這觸及當前 AI 代理設計中一個核心議題:讓模型在本地端擁有更大操作權限、能自主完成任務,代價是任何錯誤(幻覺、推理失誤、指令誤解)都可能直接造成不可逆的資料損失。
Shumer 表態:「更信任 Fable 1,000 倍」
Shumer 在原始貼文中直接寫道:「這就是為什麼我更信任 Fable 1,000 倍。」Fable 是 Anthropic 6 月底推出的最新旗艦模型 Claude Fable 5。Shumer 補充,他自己在 GPT-5.6 剛推出時發表過評測,當時就已表態偏好 Fable,並在幾週前停用 GPT-5.6 作為日常工具。
OpenAI 尚未對此事件公開發表任何官方聲明。前一日 OpenAI 剛宣告 GPT-5.6 為 Microsoft 365 Copilot 首選模型。
登入回覆
登入分享您的看法評論
相關文章