Anthropic揭Claude Code「省錢6招」!善用快取、/clear降低Token成本

Anthropic近日發布一篇部落格文章,針對開發者使用Claude Code時容易出現的Token浪費問題,整理出6項降低成本的實用技巧。
官方指出,Claude Code的使用成本不只取決於選用哪個模型,也與推理強度、上下文長度及提示快取是否命中密切相關;若缺乏上下文管理,同一項程式開發任務的成本可能出現數倍差距。
Anthropic建議,開發者完成一項任務後應立即使用「/clear」清除對話,避免前一項工作的檔案內容、指令輸出與探索過程持續留在上下文中,並在開始工作時就確定模型與推理強度,減少後續切換造成的快取失效。
Anthropic列6招降低Claude Code成本
- 在不同任務之間執行「/clear」,避免把之前無關的上下文繼續送到模型,進而減少Token消耗。
- 開始工作前,先確定好模型和推理強度,因為中途更改其中任何一個,都可能導致提示詞快取失效,進而增加Token成本。
- 不要只寫出檔名,而是直接用「@」提及文件,使檔案會直接附加到訊息中,省去一次Read調用,並避免Claude再去搜尋檔案。
- 對輸出冗長的指令加上靜默參數,或把指令交給子代理執行。因為命令輸出會像檔案一樣加入對話,並且在整個會話期間都會保留。
- 在新會話開始時執行一次「/context」。它會顯示目前載入的內容(例如 CLAUDE.md 和 MCP 工具定義),方便用戶刪除不必要的內容。
- 暫時離開鍵盤前執行「/compact」。提示詞快取通常一小時後就會過期,而在快取仍然有效時進行對話壓縮,成本要低得多。
Claude Code成本關鍵在Token如何被計算
Anthropic也進一步說明Claude Code背後的Token消耗機制。每次使用者發出指令時,模型首先需要進行「預填充」,讀取系統提示詞、CLAUDE.md、使用者訊息及過往對話等輸入內容;接著進入「解碼」(decode)階段,產生模型回覆、思考內容及工具呼叫等輸出。
兩者的運算方式並不相同。預填充會一次處理輸入內容,而解碼則是逐個Token產生輸出,因此輸出Token的成本高於輸入Token。
模型本身則決定每個Token的價格,而推理強度會影響Token使用量。
Anthropic指出,推理強度越高,模型需要產生的思考Token越多,因此開發者不應在所有任務上都使用最高推理強度,而應根據工作的複雜程度選擇合適的模型與設定。
提示快取成為降低成本的重要工具
在Claude Code的成本結構中,提示快取是另一個關鍵因素。
Claude Code的請求通常會包含相同的前綴,例如系統提示詞、工具定義、CLAUDE.md以及既有對話歷史。如果下一次請求的前綴內容與前一次完全一致,系統可以直接使用先前的計算結果,而不必重新處理全部內容。
Anthropic指出,快取讀取只要正常輸入價的0.1倍,可以直接省掉90%。雖然首次寫入快取需要較高成本,但之後的請求可以持續利用既有快取。
不過,快取並非永久有效,而且必須維持連續匹配。Anthropic列出幾種可能導致快取失效的情況,包括切換模型、改變推理強度、開啟或關閉Fast mode、使用「/compact」重新整理對話、快取逾期,以及長時間後恢復舊會話。
其中,模型與推理強度的切換尤其值得注意。Anthropic指出,不同模型各自擁有獨立快取,因此從一個模型切換到另一個模型後,原本的對話歷史可能需要重新進行預填充;推理強度同樣屬於快取條件之一。
此外,Anthropic也提醒使用者注意「opusplan」模式。由於該模式會在不同階段切換模型,因此進入或離開相關模式都可能造成快取失效,頻繁切換可能增加額外成本。
對話越長,累積成本也越高
即使成功利用快取降低重複處理成本,Anthropic仍提醒,對話本身持續膨脹仍會增加Token使用量。
Claude每讀取一個檔案、執行一次指令,都可能將相關內容加入對話歷史。隨著工作輪數增加,後續請求需要攜帶的上下文也會越來越長。
Claude Code設有機制處理過大的命令輸出:當輸出超過一定長度時,內容會被寫入暫存檔案,而對話中只保留摘要。不過,較短但仍然龐大的輸出仍可能直接留在上下文中。
例如測試工具產生大量測試結果,即使沒有超過系統設定的門檻,這些內容仍可能持續佔據後續對話空間。
因此,Anthropic再次強調,讓命令保持精簡、將大型工作交給子代理,以及適時清除或壓縮對話,都是降低上下文膨脹的重要方式。
除了「/clear」與「/compact」之外,Anthropic也提到「/rewind」。如果最近幾輪對話出現偏離,可以利用「/rewind」移除後續內容,同時保留較早的對話與快取狀態。
AI程式開發開始出現「Token管理」能力
從Anthropic整理的這些技巧可以看出,Claude Code的使用效率已不只是模型能力或程式設計技巧的問題,如何管理上下文、控制輸出、維持快取及選擇適當推理強度,也逐漸成為影響開發成本的重要因素。
對開發者而言,真正需要避免的並非單次使用大量Token,而是在長時間、多輪次的工作流程中,讓無關的上下文不斷累積,並因模型或設定切換導致原本可以重複利用的快取失效。
Anthropic此次公布的6項建議,核心邏輯也相當明確:讓每一次請求只攜帶真正需要的內容、讓能夠快取的內容持續命中,並將不必要的大量輸出隔離在主對話之外。對於高頻率使用Claude Code的開發者而言,這些操作將直接影響相同工作量下的Token消耗。