· Paul Lukic · 1 分鐘閱讀 · ai-costsai-spend-capscontext-windowcode-graph

每週 200 美元的工程師:AI 支出上限時代到了

據報導,特斯拉把每位工程師的 AI 支出限制在每週 200 美元,Uber 也在收緊類似限額。上限配給的是工作——削減上下文浪費,才是在上限之下繼續交付的方法。

本文目錄

六個月前,據報導特斯拉還在用內部儀表板按 AI token 消耗量給員工排名——燒得越多,排得越高。而從 7 月 6 日起,同一家公司把員工在第三方 AI 工具上的支出限制在每週 200 美元,超出部分需要經理簽字批准。據知情人士透露,導火線是部分工程師每週燒掉數千美元的 token,且看不到自然的天花板。上限涵蓋 Anthropic、OpenAI 和 Google 的模型——但據報導不包括 xAI 的 Grok——那是馬斯克同時執掌、特斯拉投資了 20 億美元的公司,儘管消息稱多數特斯拉工程師憑實際體驗更偏好 Claude。

而且特斯拉不是孤例:據報導 Uber 和其他公司也在收緊類似的內部限額

兩塊面板:2026 年初,內部儀表板按 AI token 消耗量給工程師排名;2026 年 7 月,同樣的支出撞上每週 200 美元、超額需經理簽批的上限

從 token 排行榜到支出上限,只用了半年。這就是 2026 年企業 AI 的全部故事,壓縮版。

為什麼上限現在冒出來

上限是需求側對剛剛轉向按量計費的供給側的回應。Claude Fable 5——當前最強的編程模型——正在退出方案包含額度,轉向用量額度計費:每百萬輸入 $10、輸出 $50(截至發稿,包含期延長至 7 月 19 日,已是第三次延期;額度用盡後沒有自動兜底——要麼付費額度,要麼換模型)。與此同時,模型競賽正在拉大底下的價格帶:OpenAI 的 GPT-5.6 系列新增了約 $1/$6 的入門檔,Grok 4.5 定在 $2/$6,Gemini 3.5 Pro 預計即將發布,帶 200 萬 token 上下文視窗、價格約 $1.25/$10。

注意這個價格帶意味著什麼。便宜檔越來越便宜,前沿檔越來越貴——而工程師只要能選,就會選前沿。當每位工程師都能每週燒掉幾千美元用最好的模型、CFO 又看不到天花板時,上限就是手邊最鈍的工具。於是公司紛紛抄起它。

但上限有一個每位工程負責人都該預見的失效模式:**它配給的是工作,不是浪費。**週三就燒到 200 美元的工程師不會停止浪費 token——他會停止交付。排行榜在上行時衡量了錯的東西;上限在下行時也衡量了錯的東西。兩者都沒問一句:token 到底花哪兒去了。

Token 到底花哪兒去了

排行榜和上限底下壓著一筆讓人不舒服的帳:編程代理花掉的錢裡,很大一塊是任務根本不需要的上下文。

代理靠關鍵字搜尋或向量相似度找程式碼——這些工具為召回率最佳化,把一切與某個詞沾邊的都返回。而在程式碼裡,真正重要的關係不是詞面相似,是依賴邊。OrderService.place_order() 呼叫一個 repository,後者用到一個快取策略。這些檔案構成一條鏈。關鍵字搜尋返回的是消防水管;鏈只有四個檔案。(我們寫過完整入門,講檢索為什麼天生過度抓取。)

Coograph 在倉庫裡附帶一個已提交的基準測試——單個固定任務(「給 OrderService.place_order() 加快取」)跑在單個已提交的 fixturebench/fixtures/sample-app/)上,兩者都在版本庫裡,任何人都能重跑。在這個任務上:

  • 樸素 grep + 讀取所有匹配檔案: 20 個檔案,約 4,764 輸入 token,21 次工具呼叫。
  • 圖最小上下文查詢: 4 個檔案,約 969 輸入 token,5 次工具呼叫。

**約 80% 的輸入 token 是雜訊。**一個有代表性的任務,不是普適保證——但機制在每個任務上都一樣:代理要麼讀鏈,要麼讀消防水管,而你工程師那 200 美元買的正是消防水管。

一根 200 美元的週預算條按基準比例切分:約 80% 花在代理根本不需要的檔案上,20% 花在真正的依賴鏈上

同一個上限,約 5 倍的活

把基準比例套到固定預算上,上限的含義就變了。如果一個任務的輸入上下文從約 4,764 token 降到約 969,同樣的花費大約能涵蓋五倍的任務量(4,764 ÷ 969 ≈ 4.9——示意性計算,僅計輸入 token;輸出和推理 token 隨任務規模變化,不隨檢索浪費變化)。週三就撞上限的工程師,現在能撐到週五還有餘量——同一個模型、同一個上限、每個任務同樣的工作量。什麼都沒被配給。被砍掉的是浪費。

長條圖:固定週預算下完成的任務量,關鍵字搜尋上下文約 1 倍,依賴圖最小上下文約 5 倍,來自已提交基準的比例

這就是給所有準備照抄特斯拉政策的人——以及所有即將活在這種政策之下的人——的換位思考。上限是症狀。病根是沒人度量過 token 到底買到了什麼。一個按「每交付一個任務花多少 token」給工程師排名的儀表板,講出的故事會和按原始燒量排名的完全不同——而一個能砍掉單任務分母的上下文層,比這兩個儀表板都值錢。

實際用起來是什麼樣

Coograph 是開源、MIT 授權的解析器和圖引擎。它用 tree-sitter 解析你的程式碼庫(Python、TypeScript、JavaScript、Go、Rust、Java、C#、Ruby 等,另有正則兜底),產出一個本地 SQLite 檔案——.code-graph/graph.db——永遠不離開你的機器。你的代理透過 MCP 工具(get_minimal_contextquery_graph)查詢它而不是 grep,一次拿到完整依賴鏈。git 鉤子在每次提交時只重新解析變更的檔案。

安裝只要幾分鐘:把 Coograph 克隆為同級目錄,在 Claude Code(或 Copilot、Cursor、Windsurf、Codex CLI、OpenCode、Aider、Cline)裡執行 /coograph-init,建構圖。它是模型無關的——這一點恰恰因為價格帶在拉大而更重要:無論任務路由給 Fable 5、GPT-5.6 還是入門檔模型,圖都會削減你餵進去的東西。這份節省和模型分流是疊加的,不是競爭的。

我們該照抄特斯拉的上限嗎?

上限給你成本可見性和一個天花板——這是正當需求。但要和削減浪費一起實施,而不是替代它。對一個浪費約 80% 上下文的代理(按我們已提交基準的比例)設上限,配給的是工程師的產出;先砍浪費,同一個上限就能買約 5 倍的任務量(示意性,僅計輸入)。

對已經被限額的工程師有幫助嗎?

直接有。上限是固定的;每任務 token 數才是你能控制的。在已提交基準上,依賴圖上下文把輸入 token 減少約 80%(4,764 → 969)、工具呼叫減少約 4 倍(21 → 5)——所以固定週預算按輸入算大約能涵蓋 5 倍的任務。真實數字取決於你的倉庫和任務構成。

這只是 Fable 5 / 貴模型的問題嗎?

不是。便宜檔縮小的是倍率,不是浪費——讀 20 個檔案才改 4 個的代理,在 $1/M 上浪費 80% 的上下文,和在 $10/M 上一模一樣。上限只是讓浪費以美元形式可見;它在延遲和配額裡一直可見。

Coograph 能配我們已經在用的代理嗎?

能。Claude Code、VS Code Copilot、Cursor、Windsurf、Codex CLI、OpenCode、Aider、Cline,透過 MCP 伺服器接入。它是上下文層,不是代理替代品——你的代理照常工作,只是讀鏈而不是讀消防水管。

開源還是付費?

整個倉庫 MIT 授權、永久免費——沒有付費牆功能。Coograph Pro 是客製服務(整合、內部語言的自訂解析器、針對你真實工作負載的基準測試),不是鎖起來的產品檔位。

排行榜時代獎勵燒 token,上限時代懲罰燒 token。但兩者都沒解決一個事實:大部分燒掉的都是雜訊——代理在讀它根本不需要的檔案,現在還附帶一道經理簽批。用入門指南生成你的第一張圖,在程式碼圖頁面看看裡面有什麼,或者如果你的團隊即將活在上限之下,聊聊 Coograph Pro。基準已提交。定預算之前,先自己重跑一遍。

削減你的 AI 編程帳單 30–80%。Coograph 採用 MIT 授權、永久免費。Pro 提供客製服務。