微软将 Foundry 模型路由器覆盖区域从 2 个扩至 28 个,新增 Claude Opus 4.8 和 GPT-5.6,使用默认配置的团队自动生效——但 API 稳定不等于行为稳定。
微软近日对 Azure Foundry Models 中的模型路由器进行了扩容,将面向全球标准部署的可用区域从原先的 2 个(East US 2 和 Sweden Central)扩充至 28 个,面向数据区域部署的可用区域扩充至 21 个,并同步更新了模型池。
新增模型包括 Anthropic Claude Opus 4.8 和 GPT-5.6 系列;同时,gpt-5-chat、gpt-5.2-chat、gpt-5.3-chat 和 DeepSeek-V3.1 因到达生命周期终点被移除。
此次更新对大多数团队默认自动生效——使用默认配置的团队无需重新部署即可获取变更,路由器端点保持稳定。配置了特定模型子集的团队则不会被自动更新;恰好是那些主动约束过模型池的团队,不受这次刷新影响。
微软的公告着重强调了"无需操作、自动完成"。但 Azure MVP 兼云工程师 Christos Panagiotidis 指出了公告中隐含未说的一个关键区别:接口保持稳定,并不意味着应用程序行为不变。模型池中新增的模型可能带来回答风格、工具选择行为、结构化输出可靠性、延迟分布、Token 使用量、拒绝行为和故障模式等方面的变化——"响应模式可能保持不变,但应用程序的业务结果可能会发生变化"。
对使用默认配置的团队而言,这意味着:两个从未经过评估的候选模型(Claude Opus 4.8 和 GPT-5.6 系列中的模型)已进入路由池,而四个此前可能被持续使用的模型已从池中消失,全部无需重新部署或版本升级触发。
Claude 模型有前置要求。 Claude 模型必须先在同一 Foundry 账户中使用匹配的 SKU 单独部署,路由器才能选择它们。在子集中引用但未提前部署,会触发 InvalidResourceProperties 错误。被加入受支持清单不等于可以直接使用。
上下文窗口有隐性约束。 有效上下文窗口等于底层模型中最小的窗口。向模型池新增一个上下文窗口更小的模型,会降低所有经由该路由转发请求的上下文上限,且无需显式通知。
路由器对输入提示词额外计费。 这部分成本叠加在底层模型费用上,意味着任何"成本节省"的表述背后都含有额外的路由加价。
从合规角度看,从 2 个区域扩展到 28 个,对有数据驻留义务的团队而言,可落地的方案增多。每次响应的 model 字段会返回实际选中的模型名称,路由决策事后可审计追溯。
此次公告没有提供任何实测数据:没有准确率指标,没有与单模型基准的成本对比,也没有路由决策的延迟开销。微软建议将初次部署视作初始配置,在接入生产流量前完成基准测试,并同步开源了一个评估管道,可在一次运行中测量质量、成本和延迟。
三种路由模式供参考:Balanced(均衡,默认,兼顾质量与成本)、Quality(质量优先,适用法律审查、医疗摘要、复杂推理)、Cost(成本优先,适用高吞吐量分类和简单问答)。切换路由模式或调整模型子集配置,最多需要五分钟生效。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断