主流AI模型推理鏈漏洞曝光,62個有效密鑰洩露
研究人員揭露,Anthropic、OpenAI 和 Google 的推理模型存在一類共同的加密設計問題。 攻擊者可藉此讀取模型隱藏的推理過程,並從開發者公開上傳的會話日誌中提取敏感資訊。 研究團隊稱,他們已從公開倉庫抓取並解碼超過 31.5 萬個推理區塊,恢復 182 組憑證,其中包括 62 個仍可使用的 API 金鑰。
這項研究由 MATS Research、ELLIS Institute Tübingen、馬克斯·普朗克智慧系統研究所和安全公司 Snyk 的研究人員提交,時間為 8 月 10 日。 目標物件是帶有「推理鏈」的模型,也就是先在內部產生一段中間推理,再給出最終答案的模型。
依文章描述,Anthropic、OpenAI 和 Google 都會對這段隱藏推理進行加密,並在後續對話中把加密區塊傳回自家伺服器,以維持上下文連續性。 問題在於,這些區塊並未綁定到具體使用者、會話或單一模型,而是在同一廠商體系內共用一把全域金鑰。
這意味著,同一廠商旗下不同模型之間可以辨識並處理彼此的加密推理區塊。 研究人員稱,攻擊者可把更強模型產生的加密推理內容,注入到限制較少的較弱模型中,再要求後者直接輸出明文內容。
研究人員以 Anthropic 為例稱,Claude Opus 4.8 的加密推理區塊可被注入 Claude Haiku 4.5,並由後者直接讀出。 類似方法也在 OpenAI 的 GPT-5.6 系列和 Google 的 Gemini 模型中重現。
文章稱,此過程不需要特殊權限,普通 API 存取權限就足以完成攻擊。 研究人員也表示,在多數測試提示下,解碼得到的推理 token 數量與 API 計費中的 thinking token 數量可以一一對應。
除讀取隱藏推理外,此漏洞還可能帶來多種風險,包括竊取模型推理模式用於蒸餾訓練、從共享日誌中提取隱私資料、在監控工具看不到的加密區塊中植入提示注入指令,以及借助防護較弱的同系模型繞過更強模型的限制。
研究團隊稱,他們從 GitHub 和 Hugging Face 上公開可見的倉庫中抓取了 315,320 個推理區塊,並從中恢復出:
- 182 組憑證
- 62 個有效 API
- p 個密碼
文章也提到,研究人員發現了 30 個個人信箱地址,以及共 367 項可辨識個人身分的資訊。 另有 6,708 份包含已解碼推理區塊的會話記錄已被抓取自公開網絡,這部分內容不會因廠商補丁上線而自動消失。
報告顯示,研究團隊依負責任揭露流程通知相關廠商後,Anthropic、OpenAI 和 Google 均已部署伺服器端緩解措施。 補丁可以降低後續風險,但無法抹去先前已被公開分享和抓取的日誌內容。
對使用推理模型 API 的開發者而言,這次事件也再次暴露出,把會話日誌直接上傳到公開倉庫,可能帶來超出預期的資料外洩後果。
登入回覆
登入分享您的看法評論
相關文章