上海AI公司StartLux正式开源专用于智能体决策的模型StartLux-Decision,涵盖0.8B至27B五档规格。该模型通过单次计算直接输出离散决策结果,在Decision Index评测中大幅超越Jev,大幅降低了智能体执行流程中的响应延迟。
9月30日,上海人工智能公司StartLux(原点星辉)宣布开源决策模型StartLux-Decision,一次性推出0.8B、2B、4B、9B、27B五档版本。团队利用自建的Auto Research管线推进递归式自我改进(RSI),仅耗时3天便完成了全系列模型的研发与验证。
在独立的Decision Index 0.2.1评测中,StartLux-Decision-27B综合得分达63.88,在38项基准中有31项领先于TypeSafe AI的Jev 1.13;在上海人工智能实验室针对Intern-Decision采用的七项公开评测中,27B版本平均准确率达到91.82%,同样高于Jev的88.74%。
传统大语言模型在充当智能体(Agent)中枢时,每一步动作往往需要生成长文本,等待时间容易层层累积。StartLux-Decision采用专用决策架构,支持选择题、是非题和等级评分,直接输出选项概率分布,避免了逐字生成的计算开销。
以客服工单为例,系统面对“订单重复扣费但显示未支付”的信息,可在一个请求中同时判断分配团队、处理时效与严重程度三项属性。

在单张NVIDIA H200、BF16精度的短请求测试中,4B版本一次回答三个问题平均耗时仅26毫秒,0.8B与2B版本分别低至12.2毫秒和15.5毫秒。结合快速线性注意力算子与CUDA Graph优化,模型大幅压缩了高频连续决策的时延。
在连续网页操作场景中,模型每一步只需判定“下一步操作哪个控件”以及“任务是否已完成”,交由底层执行器触发后再更新状态。在购物流程与后台协作测试中,模型成功完成了多约束条件下的商品筛选以及权限层级配置。
在动态交互环境中,StartLux-Decision接入了Mario、DOOM、StarCraft II等游戏环境,分别承担动作选择与宏观战略决策。在StarCraft II演示中,模型负责建造目标、兵种优先级与攻防策略的选择,战胜了游戏内置的困难难度AI。


在Decision Index 0.2.1基准测试中,27B版本在语言理解(74.5 vs 62.0)、检索与分类(66.8 vs 55.4)、工具与自动化(82.2 vs 75.1)等维度显著领先Jev 1.13,9B版本也以58.63分超过了Jev 1.13的57.91分。


在JevBench-Hard公布的111道高难度题目中,27B旗舰版本仅错误23题,较Jev 1.13少错8题;4B版本错误27题,同样优于Intern-Decision-4B的29题。


StartLux-Decision覆盖0.8B至27B共五种尺寸,各尺寸小模型在对应量级均刷新了公开榜单纪录。


为了便于边缘与本地部署,官方除了提供原始权重外,还同步发布了面向llama.cpp的GGUF格式(含BF16、Q8_0及Q4_K_M量化)。以4B规格为例,Q4_K_M版本体积压缩至2.71GB,在公开测试集上与原始权重的一致率仍达到98.3%。

模型兼容现有TypeSafe的/v1/systemone标准接口,便于开发者无缝替换现有架构。该项目的开源代码遵循Apache-2.0协议,权重文件遵循CC BY-NC 4.0协议,相关资源已在GitHub项目主页与Hugging Face模型库公开。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断