3句hello就限額,你的Claude Code額度去哪了? 一個橫跨28天的緩存Bug,和一份讓你「省點用」的官方回應
4-17%。 這是在過去一個月裡,Claude Code 的 prompt cache 讀取率。 正常水平是 97-99%。
這意味著,當你恢復一個先前的會話時,Claude Code 沒有復用之前已經處理過的上下文,而是每次都從頭處理全部內容,消耗的額度是正常情況的 10 到 20 倍。 你以為自己在延續一段對話,實際上每次都在重新開始一段全新的、全價的對話。


上圖展示了三個階段的快取讀取率比較。 v2.1.69 至 v2.1.89 期間(即 Bug 存在期),standalone 版本的快取讀取率僅有 4-17%。 v2.1.90 修復了其中一個關鍵 bug 後,冷啟動快取讀取率回到 47-99.7%。 到 v2.1.91,穩定運轉下的快取讀取率恢復到 97-99%。
值得注意的是圖表中的一個細節:v2.1.90 的範圍跨度很大(47% 到 99.7%),這是因為會話剛恢復時仍需「預熱」緩存,前幾輪的命中率偏低,但很快回到正常水平。 而在 Bug 版本中,這個預熱永遠不會發生——快取讀取永遠停留在系統提示詞的 14,500 個 token 上,所有對話歷史每次都以全價計費。
28 天,20 個版本
這個 bug 不是某次更新引入、下次更新修復的那種。 根據 npm registry 的發布記錄,引入 bug 的 v2.1.69 發佈於 3 月 4 日,修復 bug 的 v2.1.90 發佈於 4 月 1 日。 中间隔了 28 天,横跨 20 个版本。

時間軸揭示了一個耐人尋味的細節。 3 月 4 日 bug 引進後,用戶並沒有立刻大規模投訴。 直到 3 月 23 日,投訴才集中爆發,間隔了將近三週。 原因是,根據 GitHub issue #41930 的梳理,3 月 13 日至 28 日 Anthropic 曾上線 2 倍額度促銷(off-peak 時段翻倍),這在客觀上掩蓋了 bug 的影響。 促銷結束後,快取 bug 的消耗回到正常計費基線,用戶的額度瞬間「蒸發」。
Anthropic 的回应来得并不快。 3 月 26 日,也就是用戶投訴爆發三天后,工程師 Thariq Shihipar 在個人 X 帳號上宣布,高峰時段(工作日 5am-11am PT)的限額已收緊。 3 月 30 日,Anthropic 在 Reddit 上承認「用戶觸達限額的速度遠超預期」,稱已列為團隊最高優先級。 直到 4 月 1 日,團隊成員 Lydia Hallie 才發布了正式的調查結論。
整個過程中,Anthropic 沒有發布任何部落格文章、沒有發送郵件通知、沒有更新狀態頁。 所有官方溝通僅透過工程師的個人社群媒體貼文和少數 Reddit 評論完成。
你付了多少钱,能用多久?
GitHub issue #41930 匯集了數百條使用者報告。 最極端的案例是一位 Max 20x 訂閱用戶($200/月),他的 5 小時滾動視窗在 19 分鐘內就完全耗盡。 Max 5x 用戶($100/月)報告 5 小時窗口在 90 分鐘內用完。 根據 The Letter Two 報道,還有用戶稱一條簡單的「hello」就消耗了 13% 的會話配額。 一位 Pro 用戶($20/月)在 Discord 上說,他的額度「每週一就用完了,週六才重置」,30 天裡只有 12 天能正常使用。

根據 ArkNill 的基準測試,在 bug 版本 v2.1.89 上,Max 20x 計畫的 100% 配額在約 70 分鐘內就會耗盡。 他也計算了單次 --resume 操作對一個 500K token 上下文會話的額度成本,約 $0.15,因為系統會完整重播整個上下文。
「你拿的方式不對」
Lydia Hallie 的調查結論確認了兩點,一是高峰時段限額確實已收緊,二是 100 萬 token 上下文的會話消耗增大。 她稱團隊修復了一些 bug,但強調「沒有任何一個 bug 導致了多收費」。
隨後她給了四條省量建議:
1. 用 Sonnet 4.6 而非 Opus(Opus 消耗速度約為兩倍);
2. 不需要深度推理超過時降低推理強度或關閉 extended thinking;
3. 閒置超過時降低推理強度或關閉 extended thinking;
3. 閒置變量超過一小時的長會話 CLAUDE_CODE_AUTO_COMPACT_WINDOW=200000 限制上下文視窗大小。
沒有提及任何形式的限額重設或補償。
AI 播客主持人 Alex Volkov 將這份回應概括為「你拿的方式不對」(You're holding it wrong),指出 Anthropic 自己把 100 萬 token 上下文設為默認、把 Opus 作為旗艦模型推廣、把 extended thinking 作為賣點,現在卻建議用戶不要使用這些功能。
「沒有多收費」的說法也與 Claude Code 自己的更新記錄存在張力。 就在 Lydia 發布回應的前一天,v2.1.90 修復了一個自 v2.1.69 起存在的快取回歸 bug:使用 --resume 恢復會話時,本應命中緩存的請求會觸發完整的 prompt cache miss,按全價計費。 Lydia 的回應中並沒有提及這個已確認的計費異常。
文 | Sleepy.md
在那個按字收費的電報年代,筆墨即為金錢。 人們習慣將萬語千言濃縮至極致,「速歸」抵得過一封長信,「平安」是最重的叮嚷。
後來,電話牽進了家門,但長途費按分秒計費。 父母的長途電話總是言簡意賅,正事說完便匆匆掛斷,一旦話頭稍微延展,心疼話費的念頭便會掐斷剛冒頭的寒暄。
再後來,寬頻進家,上網按小時收費,人們盯著螢幕上的計時器,網頁一開即關,影片只敢下載,串流媒體在當時是個奢侈的動詞。 每一個下載進度條的盡頭,都藏著人們對「連結世界」的渴望與對「餘額不足」的忌憚。
計費的單位變了又變,省錢的本能亙古不變。
如今,Token 成了 AI 時代的貨幣。 然而,大多數人尚未學會如何在這個時代精打細算,因為我們還沒學會如何在看不見的演算法裡計算得失。
2022 年 ChatGPT 剛出來的時候,幾乎沒人關心 Token 為何。 那是 AI 的大鍋飯時代,每月花個 20 美元,想聊多少聊多少。
但自從最近 AI Agent 火起來之後,Token 花銷變成了每一個用 AI Agent 的人都必須關注的事情。
不同於一問一答的簡單對話,一個任務流的背後是成百上千次的 API 調用,Agent 的獨立思考是有代價的,每一次自我修正、每一次工具調用,都對應著賬單上數字的跳動。 然後你會發現你儲值進去的錢突然就不夠用了,而且你還不知道 Agent 到底都做了什麼。
現實生活裡,大家都知道怎麼省錢。 去菜市場買菜,我們知道把帶泥的爛葉子擇乾淨再上秤;搭計程車去機場,老司機知道避開早高峰的高架。
數位世界裡的省錢邏輯其實也一樣,只不過計費單位從「斤」和「公里」,換成了 Token。

在過去,節省是由於匱乏;而在 AI 時代,節省是為了精準。
我們希望透過這篇文章,幫你梳理出一套 AI 時代下的省錢方法論,讓你把每一分錢都花在刀刃上。
上秤前,先擇掉爛菜葉
在 AI 時代,資訊的價值不再由廣度決定,而由純度決定。
AI 的計費邏輯是依照它所讀的字數來收費。 無論你餵進去的是真知灼見,還是毫無意義的格式廢話,只要它讀了,你就得付錢。
因此,省 Token 的第一個思考方式,就是把「信噪比」刻進潛意識。
你餵給 AI 的每一個字、每一張圖、每一行程式碼,都要付錢。 所以在把任何東西交給 AI 之前,記得先問問自己:這裡面有多少是 AI 真正需要的? 有多少是带泥的烂菜叶?
像是「你好,請幫我...」這種冗長的開場白、重複的背景介紹、沒刪乾淨的程式碼註釋,都是帶泥的爛菜葉。
除此之外,最常見的浪費,就是直接把 PDF 或網頁截圖丟給 AI。 這樣的確你自己是省事了,但是 AI 時代的「省事」往往意味著「昂貴」。
一份格式完整的 PDF,除了正文內容,還包含頁首、頁尾、圖表標註、隱藏浮水印,以及大量用於排版的格式代碼。 這些東西對 AI 理解你的問題毫無幫助,但它們全部都要計費。
下次記得把 PDF 先轉成乾淨的 Markdown 文字再餵給 AI。 當你把 10MB 的 PDF 變成 10KB 的乾淨文字時,你不僅省下了 99% 的錢,還讓 AI 的大腦運行速度比以前快得多。
图片是另一个吞金兽。
在視覺模型的邏輯裡,AI 並不在乎你的照片拍得美不美,它只在乎你佔據了多少像素面積。
以 Claude 的官方計算邏輯為例:圖片的 Token 消耗 = 寬度像素 × 高度像素 ÷ 750。
一張 1000×1000 像素的圖片,消耗約 1334 個 Token,以 Claude Sonnet 4.6 的定價折算,每張圖片約 0.004 美元;
但如果把同一張圖壓縮到 200×200 像素,只消耗了 504 個成本差 50 倍。
許多人直接把手機拍的高清照片、4K 截圖丟給 AI,殊不知這些圖片消耗的 Token 可能足以讓 AI 讀完大半本中篇小說。 如果任務只是辨識圖片裡的文字或做簡單的視覺判斷,例如讓 AI 辨識發票上的金額、閱讀說明書裡的文字,或是判斷圖中是否有紅綠燈,那麼 4K 的解析度就是純純的浪費,把圖片壓縮到最小可用解析度就夠了。
但輸入端最容易浪費 Token 的原因,其實不是檔案格式,而是低效率的說話方式。
很多人把 AI 當成真人鄰居,習慣用社交式的碎碎念去溝通,先丟一句「幫我寫個網頁」,等 AI 吐出個半成品,再補充細節,再反覆拉扯。 這種擠牙膏式的對話,會讓 AI 反覆產生內容,每一輪修改都在疊加 Token 消耗。
騰訊雲的工程師在實踐中發現,同樣一個需求,擠牙膏式的多輪對話,最終消耗的 Token 往往是一次性說清楚的 3 到 5 倍。
真正的省錢之道,是放棄這種低效率的社交試探,一次性把要求、邊界條件、參考範例說清楚。 少去費力解釋「不要做什麼」,因為否定句往往比肯定句消耗更多的理解成本;直接告訴它「要怎麼做」,並給出一個清晰的正確示範。
同時,如果你知道目標在哪裡,就直接跟 AI 說清楚,別讓 AI 去當偵探。
當你命令 AI「找一下使用者相關的程式碼」時,它必須在後台進行大規模的掃描、分析與猜測;而當你直接告訴它「去看 src/services/user.ts 這個檔案」時,Token 的消耗天差地別,在數位世界裡,資訊對等就是最大的節約。
別為 AI 的「禮貌」買單
大模型計費有個潛規則很多人沒意識到:輸出 Token 通常比輸入 Token 貴 3 到 5 倍。
也就是說,AI 說出來的話,比你說給它的話貴得多。 以 Claude Sonnet 4.6 的定價為例,輸入每百萬 Token 僅需 3 美元,而輸出則陡然跳升至 15 美元,整整 5 倍的價差。
那些「好的,我已完全理解您的需求,現在開始為您解答…」的禮貌開場白,那些「希望以上內容對您有所幫助」的客套結尾,在真人溝通時是禮貌的社交辭令,但是在 API 的賬單上,這些毫無信息增量的寒暄也都是要花你自己的錢的。
解決輸出端浪費最有效的手段,是給 AI 一個規則。 用系統指令明確告訴它:不要寒暄,不要解釋,不要重述需求,直接給答案。
這些規矩只需設定一次,便在每一次對話中生效,是真正「一次投入、永久受益」的理財手段。 但在建立規矩時,很多人又陷入了另一個誤解:用冗長的自然語言去堆砌指令。
工程師的實測資料表明,指令的效能不在於字數,而在於密度。 將一段 500 字的系統提示詞壓縮到 180 字,透過刪除無意義的禮貌用語、合併重複指令、並將段落重構為簡潔的條目化清單,AI 的輸出品質幾乎毫無波動,但單次呼叫的 Token 消耗卻能驟降 64%。
還有一個更主動的控製手段,那就是限制輸出長度。 很多人從來不設定輸出上限,任由 AI 自由發揮,這種對錶達權的放任,往往會導致極度的成本失控。 你或許只需要一個點到為止的短句,AI 卻為了展現某種「智力誠意」,不由分說地為你生成了一篇 800 字的小作文。
如果你追求的是純粹的數據,就應該強制 AI 返回結構化的格式,而非冗長的自然語言描述。 在承載同等資訊量的情況下,JSON 格式的 Token 消耗遠低於散文化的段落。 這是因為結構化資料剔除了所有冗餘的連接詞、語氣詞及解釋性修飾,只保留了高濃度的邏輯核心。 在 AI 時代,你應該清醒地意識到,值得你付費的是結果的價值,而非 AI 那段毫無意義的自我詮釋。
除此之外,AI 的「過度思考」也在瘋狂蠶食你的帳戶餘額。
有些高階模型有「擴展思考」模式,會在回答之前先進行海量的內部推理。 這個推理過程也要計費,而且是以輸出的價格來計價的,非常貴。
這種模式本質上是為「需要深度邏輯支撐的複雜任務」而設計的。 但是大多數人在問簡單問題的時候也選擇了這個模式。 對於不需要深度推理的任務,明確告訴 AI「不需要解釋思路,直接給答案」,或者手動關掉擴展思考,也能幫你省不少錢。
別讓 AI 翻舊帳
大模型沒有真正的記憶,它只是在瘋狂地翻舊帳。
這是許多人不知道的一個底層機制。 每次你在對話視窗裡發出新訊息,AI 並不是從你這句話開始理解,而是把你們之前聊過的所有內容,包括每一輪對話、每一段程式碼、每一份引用文件全部重新讀一遍,然後才回答你。
在 Token 的帳單裡,這種「溫故而知新」絕非免費。 隨著對話輪次的疊加,即使你只是追問一個簡單的詞,AI 背後重讀整本舊帳的成本也會呈現幾何倍數成長。 這個機制決定了,對話歷史越沉重,你的每一句提問就越昂貴。
有人追蹤了 496 個包含 20 條以上訊息的真實對話,發現第 1 條訊息平均讀取 14,000 個 Token,每條成本約 3.6 美分;到第 50 條訊息時,平均讀取 79,000 個 Token,每條成本約 4.5 美分,貴了整整 80%。 而且上下文越來越長,到第 50 條時,AI 要重新處理的上下文已經是第 1 條時的 5.6 倍。
解決這個問題,最簡單的習慣是:一個任務,一個對話框。
當一個話題聊完,果斷開啟新對話,不要把 AI 當成一個永遠不關機的聊天視窗。 這個習慣聽起來很簡單,但很多人就是做不到,總覺得「萬一還要用到之前的內容呢」。 事實上,那些你擔心的「萬一」絕大多數時候是不會出現的,而為了這個萬一,你已經在每一條新訊息上多付了幾倍的錢。
當對話確實需要延續,但上下文已經變得很長時,我們可以利用一些工具的壓縮功能。 Claude Code 有一個/compact 指令,能把長篇大論的對話歷史濃縮成一段簡短的摘要,幫你做一次賽博斷舍離。
還有省錢邏輯叫 Prompt Caching(提示詞快取)。 如果你反覆使用同一段系統提示詞,或者每次對話都要引用同一份參考文檔,AI 會把這部分內容緩存起來,下次調用時只收取很少的緩存讀取費用,而不是每次都按全價計費。
Anthropic 的官方定價顯示,快取命中的 Token 價格是正常價格的 1/10。 OpenAI 的 Prompt Caching 同樣能把輸入成本降低約 50%。 一篇 2026 年 1 月發表在 arXiv 上的論文,對多個 AI 平台的長任務進行了測試,發現提示詞緩存能把 API 成本降低 45% 到 80%。
也就是說,同樣的內容,第一次餵給 AI 要付全價,之後每次呼叫只要付 1/10。 對於那些每天都要重複使用同一套規範文件或系統提示詞的使用者來說,這個功能能省下大量 Token。
但 Prompt Caching 有一個前提,你的系統提示詞和參考文件的內容和順序必須保持一致,而且要放在對話的最前面。 一旦內容有任何改動,快取就會失效,重新以全額計費。 所以,如果你有一套固定的工作規範,就把它寫死,不要隨意修改。
最後一個上下文管理的技巧,就是按需載入。 很多人喜歡把所有的規範、文件、注意事項一股腦塞進系統提示詞裡,理由還是那個「以防萬一」。
但這樣做的代價是,你明明只是在做一個很簡單的任務,卻被迫加載了幾千字的規則,白白浪費一堆 Token。 Claude Code 的官方文件建議把 CLAUDE.md 控制在 200 行以內,把不同場景的專案規則拆分成獨立的技能文件,用到哪個場景才加載哪個場景的規則。 保持上下文的絕對純淨,就是對算力最高級的尊重。
別開保時捷去買菜
不同的 AI 模型,價格差距龐大。
Claude Opus 4.6 每百萬 Token 輸入要 5 美元、輸出 25 美元,Claude Haiku 3.5 只要 0.8 美元輸入、4 美元輸出,差了將近 6 倍。 讓最頂級的模型去幹蒐集資料、排版格式的雜活,不僅慢,而且很貴。

聰明的用法是把我們人類社會常見的「階級分工」思維帶到 AI 社會,不同難度的任務,交給不同價位的模型。
就像在現實世界裡僱人工作,你不會專門去僱用一個年薪百萬的專家去工地搬磚。 AI 也一样。 Claude Code 的官方文件裡也明確建議:Sonnet 處理大多數程式設計任務,Opus 留給複雜的架構決策和多步驟推理,簡單的子任務指定用 Haiku。
更具體的實操方案是建構「兩段式工作流程」。 在第一階段,用免費或便宜的基礎模型做前期的髒活累活,例如資料蒐集、格式清理、初稿生成、簡單的分類和歸納。 進入第二階段,再將提煉後的高純度精華投餵給頂級模型,進行核心決策與深度精修。
舉個例子,如果你要分析一份 100 頁的產業報告,可以先用 Gemini Flash 把報告裡的關鍵數據和結論提取出來,整理成一份 10 頁的摘要,然後再把這份摘要交給 Claude Opus 做深度分析和判斷。 這種兩段式工作流程,能在保證品質的前提下,把成本大幅壓縮。
比單純的分段處理更進階的,是基於任務解構的深度分工。 一個複雜的工程任務,完全可以被拆解為數個彼此獨立的子任務,並且搭配最適合的模型。
例如一個需要寫程式碼的任務,可以讓廉價模型先寫框架和樣板程式碼,然後只把核心邏輯的部分交給昂貴模型來實現。 每個子任務有乾淨、專注的上下文,結果更準確,成本也更低。
你本來不需要花 Token
前面所有的探討,本質上都在解決「如何省錢」的戰術問題,但一個更底層的邏輯命題被很多人忽視了:這個動作,到底需不需要花 Token?
最極致的節省不是演算法的最佳化,而是決策的斷捨離。 我們習慣了向 AI 尋求萬能的解答,卻忘了在很多場景下,調用昂貴的大模型無異於高射砲打蚊子。
例如讓 AI 自動處理郵件,它會把每一封郵件都當成獨立任務去理解、分類、回复,Token 消耗巨大。 但如果你先花 30 秒掃一眼收件箱,手動篩掉那些明顯不需要 AI 處理的郵件,再把剩下的交給 AI,成本立刻降到原來的一小部分。 人的判斷力在這裡不是障礙,而是最好用的過濾器。
電報時代的人知道,每多發一個字要多花多少錢,所以他們會掂量,這是一種對資源的直覺感知。 AI 時代也是一樣,當你真正知道每讓 AI 多說一句話要多花多少錢,你自然就會掂量這件事值不值得讓 AI 來做、這個任務需要頂級模型還是廉價模型、這段上下文還有沒有用。
这种掂量,是最省钱的能力。 算力越來越貴的時代,最聰明的用法,不是讓 AI 取代人,而是讓 AI 和人去做各自擅長的事。 當這種對 Token 的敏感度內化為一種條件反射,你才真正從算力的附庸,變回了算力的主人。