前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/10.04 · 16:32/4 MIN/编译自 AGI-Signal/1 阅读

StartLux开源决策模型,多项基准超越Jev

上海AI公司StartLux正式开源专用于智能体决策的模型StartLux-Decision,涵盖0.8B至27B五档规格。该模型通过单次计算直接输出离散决策结果,在Decision Index评测中大幅超越Jev,大幅降低了智能体执行流程中的响应延迟。

9月30日,上海人工智能公司StartLux(原点星辉)宣布开源决策模型StartLux-Decision,一次性推出0.8B、2B、4B、9B、27B五档版本。团队利用自建的Auto Research管线推进递归式自我改进(RSI),仅耗时3天便完成了全系列模型的研发与验证。

在独立的Decision Index 0.2.1评测中,StartLux-Decision-27B综合得分达63.88,在38项基准中有31项领先于TypeSafe AI的Jev 1.13;在上海人工智能实验室针对Intern-Decision采用的七项公开评测中,27B版本平均准确率达到91.82%,同样高于Jev的88.74%。

单次计算完成多重判断,响应达毫秒级

传统大语言模型在充当智能体(Agent)中枢时,每一步动作往往需要生成长文本,等待时间容易层层累积。StartLux-Decision采用专用决策架构,支持选择题、是非题和等级评分,直接输出选项概率分布,避免了逐字生成的计算开销。

以客服工单为例,系统面对“订单重复扣费但显示未支付”的信息,可在一个请求中同时判断分配团队、处理时效与严重程度三项属性。

工单分流演示:一次请求完成三个判断

在单张NVIDIA H200、BF16精度的短请求测试中,4B版本一次回答三个问题平均耗时仅26毫秒,0.8B与2B版本分别低至12.2毫秒和15.5毫秒。结合快速线性注意力算子与CUDA Graph优化,模型大幅压缩了高频连续决策的时延。

从网页连续操作到游戏交互

在连续网页操作场景中,模型每一步只需判定“下一步操作哪个控件”以及“任务是否已完成”,交由底层执行器触发后再更新状态。在购物流程与后台协作测试中,模型成功完成了多约束条件下的商品筛选以及权限层级配置。

在动态交互环境中,StartLux-Decision接入了Mario、DOOM、StarCraft II等游戏环境,分别承担动作选择与宏观战略决策。在StarCraft II演示中,模型负责建造目标、兵种优先级与攻防策略的选择,战胜了游戏内置的困难难度AI。

对话对象判断演示

游戏交互测试结果

评测全面超越前代方案

在Decision Index 0.2.1基准测试中,27B版本在语言理解(74.5 vs 62.0)、检索与分类(66.8 vs 55.4)、工具与自动化(82.2 vs 75.1)等维度显著领先Jev 1.13,9B版本也以58.63分超过了Jev 1.13的57.91分。

Decision Index 0.2.1对比

各领域能力对比

在JevBench-Hard公布的111道高难度题目中,27B旗舰版本仅错误23题,较Jev 1.13少错8题;4B版本错误27题,同样优于Intern-Decision-4B的29题。

公开基准测试成绩

JevBench-Hard错误题数对比

全规格覆盖与开源生态

StartLux-Decision覆盖0.8B至27B共五种尺寸,各尺寸小模型在对应量级均刷新了公开榜单纪录。

不同尺寸模型评测

推理耗时对比

为了便于边缘与本地部署,官方除了提供原始权重外,还同步发布了面向llama.cpp的GGUF格式(含BF16、Q8_0及Q4_K_M量化)。以4B规格为例,Q4_K_M版本体积压缩至2.71GB,在公开测试集上与原始权重的一致率仍达到98.3%。

GGUF量化版本文件大小

模型兼容现有TypeSafe的/v1/systemone标准接口,便于开发者无缝替换现有架构。该项目的开源代码遵循Apache-2.0协议,权重文件遵循CC BY-NC 4.0协议,相关资源已在GitHub项目主页与Hugging Face模型库公开。

标签:开源决策模型AI智能体大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
置顶

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
置顶

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

//

24小时热榜

Kimi接入OpenAI结算体系,AMD巨资收购李飞飞团队
TOP1

Kimi接入OpenAI结算体系,AMD巨资收购李飞飞团队

Tavus发布端到端全双工视频模型Griffin
TOP2

Tavus发布端到端全双工视频模型Griffin

3

从4万美元水费账单,看生成式AI头顶的能耗乌云

2小时前
从4万美元水费账单,看生成式AI头顶的能耗乌云
4

AI写代码时代:如何防止Agent在测试里自导自演

2小时前
AI写代码时代:如何防止Agent在测试里自导自演
5

折腾三卡AI工作站:本地大模型该止步何处?

2小时前
折腾三卡AI工作站:本地大模型该止步何处?
6

大模型只是发动机,Harness 才是真正的 Agent 产品

2小时前
大模型只是发动机,Harness 才是真正的 Agent 产品
7

测试教条如何拖垮团队:职场中的“测试圣徒”悖论

2小时前
测试教条如何拖垮团队:职场中的“测试圣徒”悖论
8

买量换皮失效后,中国AI社交出海靠互动创新突围

12小时前
买量换皮失效后,中国AI社交出海靠互动创新突围
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断