Fable 5 開始按量計費:每個浪費的 token 都成了帳單項
7 月 13 日起,Claude Fable 5 從方案額度切換到按量計費:每百萬 token 輸入 $10、輸出 $50。最燒錢的習慣?代理本該讀 4 個檔案,卻讀了 20 個。
你能租到的最強編程模型,馬上要開始按 token 收費了。Claude Fable 5——6 月 9 日發布,隨後因出口管制審查下線三週,7 月 1 日重新全球部署——目前包含在 Pro、Max 和 Team 方案裡,上限為每週用量的 50%。截至發稿,這段包含期將於 7 月 12 日結束。從 7 月 13 日起,Fable 5 透過用量額度按 API 費率計費:每百萬輸入 token $10,每百萬輸出 token $50——是 Opus 4.8 的兩倍,也是 Anthropic 有史以來對公眾開放的最貴模型。額度是同一個池子,Claude.ai 和 Claude Code 共享。
所以這週每個在 Claude Code 裡跑 Fable 5 的團隊面對的問題不是「值不值」——按多數評測它是當前最強的軟體工程模型。問題是:你付的錢裡,多少花在了真正的工作上,多少花在了代理讀那些根本不需要的檔案上?
我們三週前寫過:上下文膨脹燒的是配額。換到 Fable 5,同樣的膨脹燒的是美元——而且是市面上最高的單價。
Fable 5 懲罰臃腫上下文的三種方式
費率本身
每百萬輸入 token $10,意味著代理塞進上下文的每個 token 都按 Opus 4.8 的 2 倍、Sonnet 5 首發價的 5 倍計費。不是模型變低效了——是你的習慣變貴了。grep 一個詞然後把所有匹配都讀一遍的代理從來都浪費;在 Fable 5 上,這份浪費的價籤多了一個零。
Tokenizer 稅
Fable 5 用的是 Anthropic 較新的 tokenizer(與 Opus 4.7+ 相同),同樣的文字最多會多產生 35% 的 token。同一個檔案、同一段提示、同一段貼上的堆疊追蹤——比舊模型消耗更多 token,然後才輪到更高的費率。費率 × token 膨脹是複合的:過去花 $X 輸入的內容,現在可能遠超 2X。每次多餘的檔案讀取都被徵了兩道稅。
1M 上下文的誘惑
Fable 5 的上下文視窗預設就是 100 萬 token——不用申請 beta,長上下文也不加價。這正是陷阱所在。一百萬 token 裝得下大多數中型倉庫,於是最省事的接法就是「全部倒進去,讓模型自己整理」。算一下帳:一次滿視窗請求,在模型輸出任何一個 token 之前就是 $10 的輸入費用。關於多輪代理會話的報導給過數字:滿上下文每輪重發、不做快取的十輪對話,光輸入就 $100+;用提示快取約 $21.50(約 $12.50 的快取寫入,之後讀取約每百萬 $1)。快取幫助很大。但快取一個臃腫的上下文,仍然是在付錢儲存和重讀雜訊。最便宜的 token 是你從沒載入過的那個。
解法不是更便宜的模型,是更小的上下文
這週流傳的標準建議是模型分流:把 Fable 5 留給規劃和最難的問題,批量編碼推給費率只有五分之一的 Sonnet 5。這個建議是對的——照做。但分流決定的是你燒哪個錶,不是燒多少。一個讀 20 個檔案才改 4 個的代理,在 Sonnet 上浪費 80% 的上下文,和在 Fable 上一模一樣。倍率變了,漏洞沒變。
漏洞在檢索。代理靠關鍵字搜尋或向量相似度找程式碼——這些工具為召回率最佳化,把一切沾邊的都返回。而在程式碼裡,真正重要的關係不是詞面相似,是依賴邊。OrderService.place_order() 呼叫一個 repository,後者用到一個快取策略。這些檔案構成一條鏈。關鍵字搜尋找不到這條鏈;依賴圖就是這條鏈。(完整入門見上一篇。)
基準數字,按 Fable 5 費率折算
Coograph 在倉庫裡附帶一個已提交的基準測試——單個固定任務(「給 OrderService.place_order() 加快取」)跑在單個已提交的 fixture(bench/fixtures/sample-app/)上,兩者都在版本庫裡,任何人都能重跑。在這個任務上:
- 樸素 grep + 讀取所有匹配檔案: 20 個檔案,約 4,764 輸入 token,21 次工具呼叫。
- 圖最小上下文查詢: 4 個檔案,約 969 輸入 token,5 次工具呼叫。
也就是在一個有代表性的重構任務上 token 減少約 80%、工具呼叫減少約 4 倍——只是一個任務,不是普適保證;節省幅度隨倉庫規模和改動聚焦程度變化。
現在套上 Fable 5 的價格。按每百萬輸入 token $10 計算,這個小任務走關鍵字檢索約 $0.048 輸入費用,走依賴圖約 $0.010——這是示意性算術,且基準的 token 數是在 Fable 的 tokenizer 之前測的,在 Fable 上兩邊都會膨脹最多約 35%,但比例不變。在小 fixture 上是幾分之一美分。但 fixture 很小,而機制是線性的:把同樣 80% 的浪費放大到真實倉庫——一個任務動輒拉進數萬上下文 token——再乘以團隊每週跑的任務數,這道差距決定了 Fable 5 到底是四捨五入的零頭,還是工具帳單上最大的一行。
而在 7 月 12 日之前,同樣的算術燒的不是卡而是鐘:Fable 5 從每週限額 50% 的包含額度裡扣,所以每個任務少 80% 的 token,直接等於在上限把你週中掐斷之前多跑幾個 Fable 任務。
實際用起來是什麼樣
Coograph 是開源、MIT 授權的解析器和圖引擎。它用 tree-sitter 解析你的程式碼庫(Python、TypeScript、JavaScript、Go、Rust、Java、C#、Ruby 等,另有正則兜底),產出一個本地 SQLite 檔案——.code-graph/graph.db——永遠不離開你的機器。你的代理透過 MCP 工具(get_minimal_context、query_graph)查詢它而不是 grep,一次拿到完整依賴鏈。git 鉤子在每次提交時只重新解析變更的檔案。
安裝只要幾分鐘:把 Coograph 克隆為同級目錄,在 Claude Code(或 Copilot、Cursor、Windsurf、Codex CLI、OpenCode、Aider、Cline)裡執行 /coograph-init,建構圖。它是上下文層,不是代理替代品——而且模型無關,這正是這個月的關鍵:無論任務路由給 Fable 5、Opus 4.8 還是 Sonnet 5,圖都會削減你餵進去的東西。
Coograph 能讓 Fable 5 更便宜嗎?
它透過削減輸入 token 讓每個模型都更便宜;只是 Fable 5 費率最高,所以絕對節省在它身上最大。在已提交的基準上,最小上下文把輸入 token 減少約 80%(4,764 → 969)。按 Fable 5 每百萬輸入 $10 的費率,示意性地是一個小任務從約 $0.048 降到約 $0.010——能放大到你倉庫的是比例,不是絕對數字。
7 月 13 日之前也有用嗎?
有。到 7 月 12 日為止,Fable 5 的用量從一個上限為每週方案限額 50% 的包含額度裡扣。每個任務的 token 更少,意味著上限內能跑更多 Fable 5 任務。7 月 13 日之後,同樣的削減體現為更少的用量額度消耗。
正確答案難道不是把批量工作分流給 Sonnet 5 嗎?
分流有用,你應該做——Sonnet 5 的首發費率約為 Fable 5 的五分之一。但分流選的是電錶,不縮小浪費。最小上下文在任何模型上都能砍掉約 80% 的 token。兩個都做。
提示快取呢?
要用——報導中的多輪算術顯示,快取能把樸素的 $100+ 十輪會話降到約 $21.50。但快取是在付錢儲存和重讀你載入的一切,包括雜訊(快取寫入還有溢價)。更小的上下文讓快取本身更便宜。兩者是疊加的。
開源還是付費?
整個倉庫 MIT 授權、永久免費——沒有付費牆功能。Coograph Pro 是客製服務(整合、內部語言的自訂解析器、針對你真實工作負載的基準測試),不是鎖起來的產品檔位。
Fable 5 值這個價——對那些幹活的 token 而言。花在重讀代理根本不需要的檔案上的 token,在方案限額時代就是死重,從 7 月 13 日起則是每百萬 $10 的死重。用入門指南生成你的第一張圖,在程式碼圖頁面看看裡面有什麼,或者如果團隊需要駐場整合,聊聊 Coograph Pro。基準已提交。在電錶啟動之前,自己重跑一遍。
削減你的 AI 編程帳單 30–80%。Coograph 採用 MIT 授權、永久免費。Pro 提供客製服務。