· Paul Lukic · 1 分钟阅读 · ai-costsai-spend-capscontext-windowcode-graph

每周 200 美元的工程师:AI 支出上限时代到了

据报道,特斯拉把每位工程师的 AI 支出限制在每周 200 美元,Uber 也在收紧类似限额。上限配给的是工作——削减上下文浪费,才是在上限之下继续交付的方法。

本文目录

六个月前,据报道特斯拉还在用内部仪表盘按 AI token 消耗量给员工排名——烧得越多,排得越高。而从 7 月 6 日起,同一家公司把员工在第三方 AI 工具上的支出限制在每周 200 美元,超出部分需要经理签字批准。据知情人士透露,导火索是部分工程师每周烧掉数千美元的 token,且看不到自然的天花板。上限覆盖 Anthropic、OpenAI 和 Google 的模型——但据报道不包括 xAI 的 Grok——那是马斯克同时执掌、特斯拉投资了 20 亿美元的公司,尽管消息称多数特斯拉工程师凭实际体验更偏好 Claude。

而且特斯拉不是孤例:据报道 Uber 和其他公司也在收紧类似的内部限额

两块面板:2026 年初,内部仪表盘按 AI token 消耗量给工程师排名;2026 年 7 月,同样的支出撞上每周 200 美元、超额需经理签批的上限

从 token 排行榜到支出上限,只用了半年。这就是 2026 年企业 AI 的全部故事,压缩版。

为什么上限现在冒出来

上限是需求侧对刚刚转向按量计费的供给侧的回应。Claude Fable 5——当前最强的编程模型——正在退出套餐包含额度,转向用量额度计费:每百万输入 $10、输出 $50(截至发稿,包含期延长至 7 月 19 日,已是第三次延期;额度用尽后没有自动兜底——要么付费额度,要么换模型)。与此同时,模型竞赛正在拉大底下的价格带:OpenAI 的 GPT-5.6 系列新增了约 $1/$6 的入门档,Grok 4.5 定在 $2/$6,Gemini 3.5 Pro 预计即将发布,带 200 万 token 上下文窗口、价格约 $1.25/$10。

注意这个价格带意味着什么。便宜档越来越便宜,前沿档越来越贵——而工程师只要能选,就会选前沿。当每位工程师都能每周烧掉几千美元用最好的模型、CFO 又看不到天花板时,上限就是手边最钝的工具。于是公司纷纷抄起它。

但上限有一个每位工程负责人都该预见的失效模式:**它配给的是工作,不是浪费。**周三就烧到 200 美元的工程师不会停止浪费 token——他会停止交付。排行榜在上行时衡量了错的东西;上限在下行时也衡量了错的东西。两者都没问一句:token 到底花哪儿去了。

Token 到底花哪儿去了

排行榜和上限底下压着一笔让人不舒服的账:编程代理花掉的钱里,很大一块是任务根本不需要的上下文。

代理靠关键词搜索或向量相似度找代码——这些工具为召回率优化,把一切与某个词沾边的都返回。而在代码里,真正重要的关系不是词面相似,是依赖边。OrderService.place_order() 调用一个 repository,后者用到一个缓存策略。这些文件构成一条链。关键词搜索返回的是消防水管;链只有四个文件。(我们写过完整入门,讲检索为什么天生过度抓取。)

Coograph 在仓库里附带一个已提交的基准测试——单个固定任务(“给 OrderService.place_order() 加缓存”)跑在单个已提交的 fixturebench/fixtures/sample-app/)上,两者都在版本库里,任何人都能复跑。在这个任务上:

  • 朴素 grep + 读取所有匹配文件: 20 个文件,约 4,764 输入 token,21 次工具调用。
  • 图最小上下文查询: 4 个文件,约 969 输入 token,5 次工具调用。

**约 80% 的输入 token 是噪声。**一个有代表性的任务,不是普适保证——但机制在每个任务上都一样:代理要么读链,要么读消防水管,而你工程师那 200 美元买的正是消防水管。

一根 200 美元的周预算条按基准比例切分:约 80% 花在代理根本不需要的文件上,20% 花在真正的依赖链上

同一个上限,约 5 倍的活

把基准比例套到固定预算上,上限的含义就变了。如果一个任务的输入上下文从约 4,764 token 降到约 969,同样的花费大约能覆盖五倍的任务量(4,764 ÷ 969 ≈ 4.9——示意性计算,仅计输入 token;输出和推理 token 随任务规模变化,不随检索浪费变化)。周三就撞上限的工程师,现在能撑到周五还有余量——同一个模型、同一个上限、每个任务同样的工作量。什么都没被配给。被砍掉的是浪费。

柱状图:固定周预算下完成的任务量,关键词搜索上下文约 1 倍,依赖图最小上下文约 5 倍,来自已提交基准的比例

这就是给所有准备照抄特斯拉政策的人——以及所有即将活在这种政策之下的人——的换位思考。上限是症状。病根是没人度量过 token 到底买到了什么。一个按”每交付一个任务花多少 token”给工程师排名的仪表盘,讲出的故事会和按原始烧量排名的完全不同——而一个能砍掉单任务分母的上下文层,比这两个仪表盘都值钱。

实际用起来是什么样

Coograph 是开源、MIT 许可的解析器和图引擎。它用 tree-sitter 解析你的代码库(Python、TypeScript、JavaScript、Go、Rust、Java、C#、Ruby 等,另有正则兜底),产出一个本地 SQLite 文件——.code-graph/graph.db——永远不离开你的机器。你的代理通过 MCP 工具(get_minimal_contextquery_graph)查询它而不是 grep,一次拿到完整依赖链。git 钩子在每次提交时只重新解析变更的文件。

安装只要几分钟:把 Coograph 克隆为同级目录,在 Claude Code(或 Copilot、Cursor、Windsurf、Codex CLI、OpenCode、Aider、Cline)里运行 /coograph-init,构建图。它是模型无关的——这一点恰恰因为价格带在拉大而更重要:无论任务路由给 Fable 5、GPT-5.6 还是入门档模型,图都会削减你喂进去的东西。这份节省和模型分流是叠加的,不是竞争的。

我们该照抄特斯拉的上限吗?

上限给你成本可见性和一个天花板——这是正当需求。但要和削减浪费一起实施,而不是替代它。对一个浪费约 80% 上下文的代理(按我们已提交基准的比例)设上限,配给的是工程师的产出;先砍浪费,同一个上限就能买约 5 倍的任务量(示意性,仅计输入)。

对已经被限额的工程师有帮助吗?

直接有。上限是固定的;每任务 token 数才是你能控制的。在已提交基准上,依赖图上下文把输入 token 减少约 80%(4,764 → 969)、工具调用减少约 4 倍(21 → 5)——所以固定周预算按输入算大约能覆盖 5 倍的任务。真实数字取决于你的仓库和任务构成。

这只是 Fable 5 / 贵模型的问题吗?

不是。便宜档缩小的是倍率,不是浪费——读 20 个文件才改 4 个的代理,在 $1/M 上浪费 80% 的上下文,和在 $10/M 上一模一样。上限只是让浪费以美元形式可见;它在延迟和配额里一直可见。

Coograph 能配我们已经在用的代理吗?

能。Claude Code、VS Code Copilot、Cursor、Windsurf、Codex CLI、OpenCode、Aider、Cline,通过 MCP 服务器接入。它是上下文层,不是代理替代品——你的代理照常工作,只是读链而不是读消防水管。

开源还是付费?

整个仓库 MIT 许可、永久免费——没有付费墙功能。Coograph Pro 是定制服务(集成、内部语言的自定义解析器、针对你真实工作负载的基准测试),不是锁起来的产品档位。

排行榜时代奖励烧 token,上限时代惩罚烧 token。但两者都没解决一个事实:大部分烧掉的都是噪声——代理在读它根本不需要的文件,现在还附带一道经理签批。用入门指南生成你的第一张图,在代码图页面看看里面有什么,或者如果你的团队即将活在上限之下,聊聊 Coograph Pro。基准已提交。定预算之前,先自己复跑一遍。

削减你的 AI 编程账单 30–80%。Coograph 采用 MIT 许可、永久免费。Pro 提供定制服务。