前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
教程/09.01 · 00:00/5 MIN/作者:苏晚/0 阅读

Uber 智能体请求涨 9.4 倍、账单没涨:拆开看,这不是省钱教程,是治理教程

Uber 工程部门 8 月 27 日的 AI 软件工厂复盘被普遍读成"如何用便宜模型省钱",但真正的杠杆不在 Sonnet 换 Opus,而在把成本读数装到 statusline 上、把 16 类反模式装到会话仪表盘上——省钱只是这套装表操作的滞后指标。国内团队常犯的错,是省略装表这一步。

Uber 工程部门 8 月 27 日发了一份复盘(Running a Software Factory Efficiently at Uber Scale,作者 Uday Kiran Medisetty,Distinguished Engineer):从 2 月到 8 月,超过 70% 的合并请求由本地或云端智能体产出,全员的智能体周活跃用户涨了 7 倍、周智能体请求量涨了 9.4 倍,同期 AI 总支出自 4 月起基本持平。固定模型口径的对照测试里,每千次请求成本较峰值降了近 34%,单会话成本自 6 月峰值降了 52%。InfoQ 中文版随后翻译了全文。

这份复盘容易被读成一份省钱清单:把 Opus 换成 Sonnet、把 5 分钟缓存改成 1 小时、把 MCP 换成 CLI。这些机制都在原文里、也都有效。但把它们当做入口读,是一种错读。真正的杠杆不在这些技巧,而在 Uber 先把"每次调用花了多少钱"装进了终端 statusline,把"这次会话踩了哪几种浪费模式"装进了自动化仪表盘。34% 和 52% 的降幅是这套装表操作的滞后指标,顺序反了就都不奏效。

四层不是架构图,是治理边界

图说:Uber 把智能体运行分成从"专用"到"通用"的四个层级,越靠上,成本与质量越可控。图片来源:Uber Engineering

Uber 把智能体运行拆成四层。最内层是 Specialized Agents——Minion 处理 intent→PR、uReview 做代码评审、Agentic XP 跑 XP 完成、Conan 做告警根因分析、Fawkes 负责代码维护——任务边界最窄、指标最硬(cost/merged PR、cost/review、cost/alert、cost/cleanup),可以直接指定 Pareto 最优的模型;往外一层是 General Agents,跨领域托管,指标是 cost/query;再往外是自带 Skills 的会话,Uber 提到有 3600 多个金牌 Skills 在被复用,指标是 cost/session;最外层是 Raw Sessions——Claude Code、Codex、OpenCode 直接给工程师用,原文明说这一层"没有任务边界"。

这张四层图很容易被当成架构示意,其实它是一张治理权限图:从内到外,每一层能对模型硬约束的程度是不同的。最内层可以把模型型号、推理强度、上下文上限、超时都写死;最外层能做的只是"给个建议"。理解这一点之后,很多决策会自动落位——什么样的智能体值得投人做基准与 Pareto 选型?只有能收进内两层的。什么样的场景只能靠 statusline 提示工程师自觉?最外层的裸会话。把每层的"可控力"想清楚,"该在哪一层投优化预算"就没有争议。

六项相乘,多数团队优化错了因子

图说:Uber 把成本公式各项映射到具体优化手段。图片来源:Uber Engineering

Uber 把总支出写成六项相乘:用户数 × 每用户请求数 × 每请求输入 token × 每请求输出 token × 每次调用轮次 × 每 token 价格。前两项是采用率与参与度,Uber 明说这两项越涨越好;中间三项才是优化空间。

这个拆解本身不新,但它像一把尺子,能量出很多团队日常汇报里的错位。"我们的智能体使用量涨了 3 倍"——那是前两项,是业务健康指标,不是优化成果;"我们换了 Sonnet"——那是最后一项,Uber 提醒这项的操作空间其实最小(供应商定价你改不了,你能改的是路由);真正复利最大的是"每请求 token"和"每次调用轮次"这两项——每一轮对话都会把完整上下文再传一次,减 1000 token 会在整轮会话里连乘。Uber 在这两项上做的动作最多:40 万 token 自动压缩、推理强度默认设中等、提示缓存策略分场景、MCP 改走 CLI、代码模式批处理、2400 万节点/8000 万边的上下文图谱做锚定。顺序不是"先换模型再优化 token",而是"先摁住 token 再谈换模型"。

三个能搬的杠杆

Pareto 选型不是选便宜的,是选实测最优的

图说:Uber 用真实 PR 构建 uReview 基准,10 组配置画进 F1×成本坐标系,帕累托前沿之外的都存在更优替代。图片来源:Uber Engineering

uReview 的对比图有 10 组配置。生产在跑的是 Frontier Model C:每次 review 0.47 美元、F1 0.50。旁边并列的 Open-Weight Model A 更便宜(0.28 美元、F1 0.48),也在前沿曲线上——两者都是合理选择,取决于愿不愿意用 F1 少 0.02 换省 40%。真正被这张图排除的是虚线左下方的所有点:那里的配置既更贵、F1 也更低。有一处特别值得国内团队警觉:Frontier Model B 用两种 Harness 分别测出 2.22 美元和 0.94 美元,同一个模型换个封装层差 2.4 倍成本。选型的分歧,很多时候不是模型的分歧,是 Harness 的分歧;这条隐含结论比"选哪家模型"更重要。

提示缓存 TTL 分场景,不分默认值

图说:主对话选 1 小时 TTL 便宜 39%,子智能体选 5 分钟便宜 31%——同一个策略在两种会话形态里给出反向答案。图片来源:Uber Engineering

苏晚
苏晚Su Wan

前途科技 · 前沿主笔

关注 AI 与前沿科技的观察者,前途科技前沿内容主笔。

查看全部文章

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来
置顶

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来

Uber 智能体请求涨 9.4 倍、账单没涨:拆开看,这不是省钱教程,是治理教程
置顶

Uber 智能体请求涨 9.4 倍、账单没涨:拆开看,这不是省钱教程,是治理教程

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

Anthropic 的定价里,缓存读取是标准输入 token 的 0.1 倍,写入溢价 5 分钟档 1.25 倍、1 小时档 2 倍。Uber 的测算是:主对话工程师经常空闲超过 5 分钟,5 分钟缓存会在读代码/开会/等工具调用之间反复过期重建,累计下来 5 分钟 TTL 相当于 3.95 倍开销、1 小时 TTL 是 2.40 倍,1 小时便宜 39%;子智能体寿命 90 秒内跑完,没有超过 5 分钟的空隙,1 小时溢价买不到任何缓存复用,反倒比 5 分钟贵 45%。同一个供应商、同一个模型、同一套缓存机制,两种会话形态给出完全反向的答案。默认值必然错一半——只能按会话形态分场景配置。

这条不能直接套到国内。国产主流模型的缓存产品化程度不一,是否提供 TTL 档位、写入溢价是几倍、读价折扣多少,各家差别很大。想把这条策略移过来,得先把供应商的缓存价目吃透——没有"读价 / 5 分钟写溢价 / 1 小时写溢价"这三个数,就画不出 Uber 那张对比表。

代码模式:把 MCP 从上下文里搬出去

图说:左侧是标准 MCP 工具调用,每一轮 poll 都进上下文;右侧是代码模式,中间轮询在子进程里跑,只有摘要回到模型。图片来源:Uber Engineering

一次 SQL 查询在标准 MCP 下要 903 个 token(提交→轮询 2-5 次→取结果,每一步都进模型上下文);改成代码模式后是 402 token,省 55%。批处理放大到 5 条同类查询,节省能到 90% 以上。Uber 内部 MCP 网关有 1000+ 工具全部映射成 CLI 命令,不再直接注入 Schema;100 个工具装齐的 MCP Schema 大约会给初始提示带来 5 万到 7 万 token 的开销,改成"工具检索 + CLI 解析"后,会话开始时上下文里的工具定义"接近零"。这条是三个杠杆里最普适的:它跟模型无关、跟供应商定价无关,只跟运行时的工具协议有关。国内团队想搬,路径也清楚——把 MCP 服务器藏在 CLI 后面,让模型写脚本调 CLI,中间态不进上下文。

真正的护城河:装在终端和仪表盘里

Uber 分五层做指标:Portfolio 层看总账走向、Unit economics 层看每工具经济学、Model economics 层看模型换代对账单的影响、Driver decomposition 层把变化拆解到六项因子、Managed agent outcomes 层看每个托管智能体的单位价值(cost per merged PR、cost per review、cost per alert、cost per cleanup)。同一个 34% 降幅,在这五层里能被拆到人、拆到工具、拆到模型、拆到因子;只有拆得开的下降,才知道是真降了、还是负载搬家了。反过来,一个没有 Managed agent outcomes 层的团队,连"这个智能体是不是变贵了"都答不上来。

面向工程师的一侧是 statusline 和会话分析仪表盘。终端 statusline 实时显示本次会话花了多少钱、这个用户总共花了多少;Slack 提醒在预期支出的 50%/80%/100% 触发;会话分析仪表盘自动识别 16 类反模式,Uber 原文列出的四类是:次优模型路由(简单多轮跑在 Opus 上、Sonnet 就够)、上下文膨胀(40KB 的 MCP 响应长期留在上下文里被反复计费)、缓存过期低效(长时间中断后恢复,缓存过期,前缀被完整重建)、提示词初始化开销(用户还没输入,10 万 token 的系统指令和工具定义已经预加载)。剩下 12 类原文没披露,但结构是清楚的——只要装了指标看板,反模式列表是可以生长的。

这一层,才是 Uber 复盘和市面上大多数省钱贴的分野。省钱贴给你参数(TTL、40 万 token、Sonnet),Uber 的复盘给你尺子。有尺子才能知道你的团队踩了哪几类反模式;有尺子才能判断某次换模型是省了钱、还是把 F1 分数拉了下去。

落到国内:能搬、搬不动、需要重设

能直接搬的:statusline 成本读数(几行代码,Claude Code、Codex 都能加)、MCP→CLI 的收敛(跟供应商无关,只跟运行时有关)、按周/月的驱动因子分解看板(Excel 就能做,先把六项因子的数据源接上)。这三件事都不要模型改造,只要把测量装上。

搬不动的:40 万 token 自动压缩阈值——各家国产模型的实际上下文上限不一致,得按各家上限重设;提示缓存的 TTL 分场景策略——供应商如果不给档位就没法分场景;uReview 那种"用真实 PR 做基准"——需要有历史评审数据集与 F1/召回率标注,多数团队没有这个语料,Uber 内部先攒了几千个真实 PR 才能画出前沿曲线。

需要重新设计的:Uber 用的是 Anthropic + Claude Code,token 计价与 tokenizer 相对稳定;国内团队常见组合是通义、DeepSeek、豆包混用,不同 tokenizer 下的"每请求 token"根本不能横向比——同一份文本,不同厂商切出来的 token 数量不同。Uber 那六项公式在国内要能用,最后一项(每 token 价格)必须先按各家 tokenizer 折算,或者直接换成"每千字符成本"、"每千词成本"这类可比口径,否则横比出来的结论就是错的。

Uber 这份复盘给出的顺序是反直觉的:先装表,再开车。国内团队常见的顺序是先换便宜模型、先谈裁负载、先想 RAG 优化——表都没装,看什么效果?34% 不是终点,是这套顺序跑通之后的自然结果。

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」
置顶

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」

//

24小时热榜

Product OS:AI产品团队的闭环实践
TOP1

Product OS:AI产品团队的闭环实践

思想的几何:思想是路,不是物
TOP2

思想的几何:思想是路,不是物

3

Anthropic 加强 AI 安全与对齐

3小时前
Anthropic 加强 AI 安全与对齐
4

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来

3小时前
Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来
5

量子时代已至:企业领导者须立即行动

3小时前
量子时代已至:企业领导者须立即行动
6

AI伴侣狂潮:数千万人与代码的亲密关系

3小时前
7

从推理到实验:企业AI的培根式变革

3小时前
从推理到实验:企业AI的培根式变革
8

后训练才是大模型的真战场

3小时前
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断