前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/10.04 · 19:41/4 MIN/编译自 极客公园/1 阅读

Jev 引爆决策模型热潮,中国团队为何押注开源与本地化?

专司判断而非生成的“决策模型”Jev 上线后,OpenAI、Cloudflare 及中国团队迅速跟进。上海 AI 实验室与陈大年创办的 StartLux 纷纷选择开源与端侧本地部署,将极低成本的高频决策能力作为 AI 智能体落地的关键组件。

9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创立的 TypeSafe AI 发布了 Jev。这款模型不写一段文字,专门负责做判断。

仅仅两周后,整个大模型行业便集体涌向同一赛道:OpenAI 在开发者日上线 Decisions API,Cloudflare 紧接着开源 Clef,亚马逊也推出 Strands Decider。国内阵营同样动作迅速,上海人工智能实验室开源了多模态决策模型 Intern-Decision;成立不足五个月的上海创业公司 StartLux(原点星辉)也推出开源模型 StartLux-Decision,并在自测基准中直指 Jev。

从单点突破演变为全面群战,决策模型只用了半个月。这家由盛大网络联合创始人陈大年掌舵的创业团队,折射出中国开发者在“直觉层”上的全新解法。

什么是决策模型?

TypeSafe 将 Jev 称为“系统一(System One)模型”,典故出自认知心理学中的双系统理论:系统一对应快速、直觉的决断,系统二负责复杂的深度推演。过去两年,大语言模型几乎全在向系统二内卷——推理链越来越长,思考深度越来越高。

然而,当 AI 智能体(Agent)进入实际工程阶段,痛点完全改变。在真实的智能体执行链条中,高密度的需求并不是复杂的长文本推理,而是海量细碎的选择:工单应流转到哪个部门、终端命令是否允许执行、页面下一步点击哪个元素、当前步骤是否已终止。

在此之前,这类需求要么交给常规大语言模型,依靠生成文本再行正则解析,既慢又贵;要么依赖硬编码规则,面对长尾场景力不从心。Jev 则彻底摒弃自由文本生成,仅对带有预设选项的单选、打分或布尔判断返回带概率的结构化数据,并将定价压缩至每百万输入 Token 仅 0.042 美元,输出完全免费。

它本质上是将“判断”从“生成”中解耦,变成了极低成本、超高频调用的底层基础设施。Vercel 监测显示,Jev 发布 24 小时内便吸引了其 AI Gateway 上 13% 的付费用户,采纳速度创下平台历史纪录。

但 Jev 是一款纯粹的闭源云端 API,不开放权重,更无法离线部署。这一短板,恰恰成了后续开源力量的突破口。

中国开源力量的跟进路线

上海人工智能实验室的 Intern-Decision 涵盖 0.8B、2B 与 4B 三档尺寸,主打视觉界面理解与多模态决策,实测推理速度达 Jev 的 2 至 3 倍。

StartLux 则直接推出 0.8B 至 27B 的完整规格梯度,并提供全套量化文件,重心全面偏向本地化部署。

StartLux 模型分数对比

在 StartLux 公开的自测数据中,其 27B 版本在 Decision Index 评测集的 38 项任务中有 31 项领先 Jev 1.13,综合得分 63.88 对 57.91。官方演示中还展现了以 35 胜 1 负击败主流引擎的国际象棋对局能力。

StartLux 模型棋局演示

客观而言,在瞬息万变的决策模型榜单上,单项排名的参考价值正在迅速衰减。更值得关注的是生态底层的走向:无论是 Cloudflare 的 Clef、亚马逊的 Strands Decider,还是 StartLux 的架构,均深度依赖 Qwen 作为基础底座后训练完成。中国开源基座已经事实性地成为全球决策模型的核心支架。

为何聚焦端侧与本地场景?

在盛大、WiFi 万能钥匙之后重回一线的陈大年,将 StartLux 的核心路线确立为“本地化 AI 系统”。

与云端可以无限堆叠集群算力不同,消费级 PC 和边缘设备的显存与功耗存在不可逾越的物理上限。若让庞大的通用底座处理每一个细小的分支判断,本地 AI 智能体根本无法流畅运转。StartLux 数据显示,其 4B 决策模型经 Q4 量化后体积压缩至 2.71GB,而决策一致率仍保持在 98.3%。

在这套架构下,27B 通用模型承载理解与生成能力,4B 或更小尺寸的决策模型负责高频分支裁决,上层结合长期记忆与调度机制,底层打通量化推理引擎。决策模型并非跟风产物,而是本地个人 AI 系统跑通工程闭环不可或缺的减负构件。

Jev 的爆发验证了“智能分层解耦”在商业与技术上的可行性,而 StartLux 借助自研的 Auto Research 数据训练闭环,在 3 天内完成了首代产品的构建。

判断层会走向白菜价吗?

从 Jev 闭源首发,到 OpenAI、Cloudflare 和中国开源团队竞相跟进,整个过程不足一个月。这也印证了一个现实:单一的决策模型由于逻辑清晰、目标收敛,很难构筑长期的技术垄断护城河,极速走向低价乃至开源是必然趋势。

对于致力于端侧智能的团队而言,真正的挑战并不在于微调出一个在基准测试中拔得头筹的小模型,而在于长链路任务的抗干扰性、异常中断后的状态恢复、上下文管理的开销以及终端用户的综合体验。

当底层的高频判断能力彻底沦为通用基础设施,价值分配的天平也将随之倾斜——决定胜负的不再是单一决策能力的高低,而是谁能将这些模块高效组装进真正可用的端侧产品中。

标签:Jev决策模型AI智能体端侧AI开源

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
置顶

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
置顶

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

//

24小时热榜

Kimi接入OpenAI结算体系,AMD巨资收购李飞飞团队
TOP1

Kimi接入OpenAI结算体系,AMD巨资收购李飞飞团队

Tavus发布端到端全双工视频模型Griffin
TOP2

Tavus发布端到端全双工视频模型Griffin

3

从4万美元水费账单,看生成式AI头顶的能耗乌云

2小时前
从4万美元水费账单,看生成式AI头顶的能耗乌云
4

AI写代码时代:如何防止Agent在测试里自导自演

2小时前
AI写代码时代:如何防止Agent在测试里自导自演
5

折腾三卡AI工作站:本地大模型该止步何处?

2小时前
折腾三卡AI工作站:本地大模型该止步何处?
6

大模型只是发动机,Harness 才是真正的 Agent 产品

2小时前
大模型只是发动机,Harness 才是真正的 Agent 产品
7

测试教条如何拖垮团队:职场中的“测试圣徒”悖论

2小时前
测试教条如何拖垮团队:职场中的“测试圣徒”悖论
8

买量换皮失效后,中国AI社交出海靠互动创新突围

12小时前
买量换皮失效后,中国AI社交出海靠互动创新突围
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断