GitHub 将 Project HydraFusion 纳入 Copilot 研究预览,通过运行时多模型编排在三项智能体编程基准上媲美 Claude Opus 5 质量,估算成本低 67%。同日 IFM 发布 K2 Horizon,六模型族从 0.9B 到 375B 完整开源,包含 Agent 后训练全流程数据。
GitHub 于本周将 Project HydraFusion 作为研究预览版纳入 GitHub Copilot,同日 IFM 发布 K2 Horizon 六模型族——两支团队在同一天分别展示了通过多模型组合实现高质量推理、同时压低成本的两种路径。
开发者调用 AI 模型的流程其实已经是多步骤的:先用一个模型起草,再叫另一个审查,遇到难题再升级到更强的。HydraFusion 把这个人工决策过程搬进了运行时——开发者选择一次 HydraFusion,框架自动为每个请求选择执行路径。
当前有三种执行模式:Single(直接由单一模型完成)、Cascade(先用轻量模型,答案通不过验收门再升级到更强模型)、Critique(主模型起草后由独立模型审查修订,适合需要多角度核查的任务)。
框架的核心是选择性:并非每个请求都走最贵的路径,而是根据请求所需的推理、代码生成、调试或工具调用能力,选预期最高效的模式。只有当轻量路径被判断为不够用时,才会向上升级。
评估数字来自三项智能体编程基准的离线测试。在 TerminalBench 2.1 上,HydraFusion 的已验证任务通过率比 Claude Opus 5 高出 4.9 个百分点,估算工作流成本则低 67%。这个差距主要来自 Cascade 和 Single 模式的命中率——大多数请求不需要最强的模型。
HydraFusion 目前作为研究预览在 GitHub Copilot 中可用,是框架层面的发布,不涉及新的基础模型。
IFM 同日发布的 K2 Horizon 包含六个模型:0.9B、3.7B、7B、32B、36B-A4B 和 375B-A23B,部署场景从智能手表横跨至企业服务器。六个模型共享核心架构、词表(0.9B 使用更小的词表)、训练方法和评估框架,可在不同尺寸间动态路由。
36B-A4B 搭载新设计的混合价值注意力机制(MoVA,Mixture-of-Value-Attention),声称在更少激活参数下达到更大模型的能力。0.9B、3.7B、7B 三个尺寸声称在各自参数量级内达到了新的 SOTA,独立复测将是验证这些数字的关键。
开放程度是 K2 Horizon 主打的差异点:从预训练到 Agent 后训练的完整生命周期——中间检查点、训练数据(或数据构建配方)、代码、配置、训练日志和最终权重——全部开放,协议为 Apache 2.0。IFM 将这称为首个完整开放 Agent 后训练过程的模型族。
HydraFusion 目前是研究预览,GitHub 后续会根据实际使用反馈调整执行模式的选择策略。K2 Horizon 完全开源,独立基准复测和社区精调实验是下一个观察点——开放的训练数据和代码让第三方验证成为可能。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断