BTCC / BTCC Square / Abmedia /
研究揭 AI「內心話」可被解密:主流模型思考鏈全洩

研究揭 AI「內心話」可被解密:主流模型思考鏈全洩

Abmedia
Author:
Abmedia
發佈時間:
2026-08-13 11:13:30
0

你以為 AI 模型「藏起來」的思考過程是加密安全的,其實可能被整包解開。根據 Decrypt 報導,一篇 8 月 10 日提交的研究揭露,Anthropic、OpenAI 與 Google 的推理模型,用來加密「內心思考鏈」的做法存在重大弱點,讓外界得以解出這些原本看不到的內部推理。

單一全域金鑰:加密的思考鏈可被互換解密

這篇論文由 MATS Research、圖賓根 ELLIS 研究所、馬克斯普朗克智慧系統研究所與資安公司 Snyk 的團隊共同提出,鎖定的是「推理模型」—這類模型不會立刻回答,而是先在一個看不見的「草稿區」一步步想過(也就是思考鏈,chain-of-thought),再給出最終答案。Anthropic、OpenAI、Google 都會把這段草稿加密。問題在於,研究發現各大業者是用「單一全域金鑰」加密推理 token,導致這些加密後的推理區塊,竟然可以跨工作階段、跨使用者、甚至跨模型互相通用—等於留下了一把萬能鑰匙。

解出 31 萬個推理區塊,藏在裡面的祕密全都露

殺傷力來自一個開發者的日常習慣:很多人會把 AI 代理的工作日誌(含加密的思考過程)公開貼到 GitHub、Hugging Face 上協作或除錯,卻不知道那些加密區塊裡藏著敏感資料。研究團隊抓取了 6,708 份公開的 AI 代理對話紀錄,成功解出其中 31 萬 5,320 個推理區塊;而這些祕密大多從未出現在模型「可見的」輸出裡,只存在於加密的思考過程中,不跑這套攻擊根本看不到。這也再度呼應近期的 AI 資安警訊:從 AI 模型在測試中「越獄」,到 PDF 隱形指令劫持 AI 助理,都指向同一件事—當 AI 承載愈多敏感任務,它的每一層(包括「看不見的思考」)都可能成為新的攻擊面。

本站轉載文章皆來自公開網絡,部分由AI整理,僅為傳遞產業訊息,不代表BTCC立場。原創權益歸原作者所有。如發現版權問題,請透過[email protected]聯絡我們,我們將依法處理。 BTCC不對資訊準確性、時效性及完整性作任何保證,不承擔因依賴資訊而產生的任何責任。內容僅供參考,不構成投資、法律或商業建議。