俄罗斯初创公司 Mostik 开发了一种方法,让 AI 模型通过权重中的数学值直接交流,无需生成文字输出,将 GLM-5.2(7530 亿参数)与 Qwen-3.5(40 亿参数)融合后,成本降至前者的 1/20,性能居两者中间。

Mostik 的技术示意插图(来源:Wired)
一家名为 Mostik(俄语「小桥」)的俄罗斯初创公司开发了一种让 AI 模型相互交流的新方式:不是让一个模型的输出成为另一个模型的输入,而是通过权重中的数学值直接传递能力,跳过文字生成这个中间步骤。Wired 记者与 Mostik 团队会面,报道了这套系统的工作方式和演示结果。
Mostik 团队构建了一条从 GLM-5.2 最大版本(7530 亿参数)到 Qwen-3.5(40 亿参数,可在手机上运行)的「桥」。融合后的混合系统成本仅为完整 GLM-5.2 的 1/20,性能落在两个模型的正中间。
更让外界关注的是:Mostik 用类似方法参加了 ARC-AGI 3——一个以极难出名的 AI 能力测试——并冲到排行榜首位。团队因为竞赛保密没有透露细节,但确认了这一成绩。
公司 CEO Sasha Malysheva 解释了这套方法的直觉:「集成」(ensemble)在机器学习中是经典思路——把多个模型的输出平均后,通常比任何单个模型都更准确。Mostik 的做法是把这个「平均」从输出层移到权重层:模型通过权重中的数学值相互传递信号,而不需要各自生成文字再汇总。
Malysheva 用一个比喻解释:数学界有个经典实验,一群随机的人对一头猪的体重进行估算,把所有估算平均后,结果比任何专家单独判断都更准——Mostik 的做法是让这些人在给出答案之前先「无语言地」交换信息。
AI 软件公司 Lovable 的技术负责人 Vladimir Arustamian 评价:「他们几个月内就做出了我原本以为需要几年的东西。」
如果这套方法成立,它对开放权重模型生态的影响是明显的:开发者可以把专门训练的小模型(生物、物理、代码等垂直领域)与更大的通用模型融合,而不是从头训练大型专门模型,成本会低得多。
Malysheva 认为 AI 的未来走向是「多个模型协作」而不是「单一大模型」,与目前 Anthropic、OpenAI 等主要实验室「做更大的模型」的主流路线方向相反。这一判断能否成立,要看 Mostik 的方法是否在更多场景和模型组合中可复制。公司目前仍未公开技术细节,ARC-AGI 3 竞赛结果是目前外界能看到的最直接证据。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断