专司判断而非生成的“决策模型”Jev 上线后,OpenAI、Cloudflare 及中国团队迅速跟进。上海 AI 实验室与陈大年创办的 StartLux 纷纷选择开源与端侧本地部署,将极低成本的高频决策能力作为 AI 智能体落地的关键组件。
9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创立的 TypeSafe AI 发布了 Jev。这款模型不写一段文字,专门负责做判断。
仅仅两周后,整个大模型行业便集体涌向同一赛道:OpenAI 在开发者日上线 Decisions API,Cloudflare 紧接着开源 Clef,亚马逊也推出 Strands Decider。国内阵营同样动作迅速,上海人工智能实验室开源了多模态决策模型 Intern-Decision;成立不足五个月的上海创业公司 StartLux(原点星辉)也推出开源模型 StartLux-Decision,并在自测基准中直指 Jev。
从单点突破演变为全面群战,决策模型只用了半个月。这家由盛大网络联合创始人陈大年掌舵的创业团队,折射出中国开发者在“直觉层”上的全新解法。
TypeSafe 将 Jev 称为“系统一(System One)模型”,典故出自认知心理学中的双系统理论:系统一对应快速、直觉的决断,系统二负责复杂的深度推演。过去两年,大语言模型几乎全在向系统二内卷——推理链越来越长,思考深度越来越高。
然而,当 AI 智能体(Agent)进入实际工程阶段,痛点完全改变。在真实的智能体执行链条中,高密度的需求并不是复杂的长文本推理,而是海量细碎的选择:工单应流转到哪个部门、终端命令是否允许执行、页面下一步点击哪个元素、当前步骤是否已终止。
在此之前,这类需求要么交给常规大语言模型,依靠生成文本再行正则解析,既慢又贵;要么依赖硬编码规则,面对长尾场景力不从心。Jev 则彻底摒弃自由文本生成,仅对带有预设选项的单选、打分或布尔判断返回带概率的结构化数据,并将定价压缩至每百万输入 Token 仅 0.042 美元,输出完全免费。
它本质上是将“判断”从“生成”中解耦,变成了极低成本、超高频调用的底层基础设施。Vercel 监测显示,Jev 发布 24 小时内便吸引了其 AI Gateway 上 13% 的付费用户,采纳速度创下平台历史纪录。
但 Jev 是一款纯粹的闭源云端 API,不开放权重,更无法离线部署。这一短板,恰恰成了后续开源力量的突破口。
上海人工智能实验室的 Intern-Decision 涵盖 0.8B、2B 与 4B 三档尺寸,主打视觉界面理解与多模态决策,实测推理速度达 Jev 的 2 至 3 倍。
StartLux 则直接推出 0.8B 至 27B 的完整规格梯度,并提供全套量化文件,重心全面偏向本地化部署。

在 StartLux 公开的自测数据中,其 27B 版本在 Decision Index 评测集的 38 项任务中有 31 项领先 Jev 1.13,综合得分 63.88 对 57.91。官方演示中还展现了以 35 胜 1 负击败主流引擎的国际象棋对局能力。

客观而言,在瞬息万变的决策模型榜单上,单项排名的参考价值正在迅速衰减。更值得关注的是生态底层的走向:无论是 Cloudflare 的 Clef、亚马逊的 Strands Decider,还是 StartLux 的架构,均深度依赖 Qwen 作为基础底座后训练完成。中国开源基座已经事实性地成为全球决策模型的核心支架。
在盛大、WiFi 万能钥匙之后重回一线的陈大年,将 StartLux 的核心路线确立为“本地化 AI 系统”。
与云端可以无限堆叠集群算力不同,消费级 PC 和边缘设备的显存与功耗存在不可逾越的物理上限。若让庞大的通用底座处理每一个细小的分支判断,本地 AI 智能体根本无法流畅运转。StartLux 数据显示,其 4B 决策模型经 Q4 量化后体积压缩至 2.71GB,而决策一致率仍保持在 98.3%。
在这套架构下,27B 通用模型承载理解与生成能力,4B 或更小尺寸的决策模型负责高频分支裁决,上层结合长期记忆与调度机制,底层打通量化推理引擎。决策模型并非跟风产物,而是本地个人 AI 系统跑通工程闭环不可或缺的减负构件。
Jev 的爆发验证了“智能分层解耦”在商业与技术上的可行性,而 StartLux 借助自研的 Auto Research 数据训练闭环,在 3 天内完成了首代产品的构建。
从 Jev 闭源首发,到 OpenAI、Cloudflare 和中国开源团队竞相跟进,整个过程不足一个月。这也印证了一个现实:单一的决策模型由于逻辑清晰、目标收敛,很难构筑长期的技术垄断护城河,极速走向低价乃至开源是必然趋势。
对于致力于端侧智能的团队而言,真正的挑战并不在于微调出一个在基准测试中拔得头筹的小模型,而在于长链路任务的抗干扰性、异常中断后的状态恢复、上下文管理的开销以及终端用户的综合体验。
当底层的高频判断能力彻底沦为通用基础设施,价值分配的天平也将随之倾斜——决定胜负的不再是单一决策能力的高低,而是谁能将这些模块高效组装进真正可用的端侧产品中。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断