清华大学与稳准智能联合发布 400M 结构化数据基础模型 LimiX-2,在 TabArena 等三大国际基准测试中均登顶第一,超越 Google 与 SAP 等厂商。模型首创上下文机制网络,推动表格模型从预测迈向因果结构发现。
稳准智能联合清华大学计算机系崔鹏教授团队,正式发布新一代结构化数据基础模型 LimiX-2,并将模型参数规模扩展至 400M。
在 TabArena、BCCO 和 TALENT 三大国际主流结构化数据评测基准中,LimiX-2 表现亮眼,总体 Elo 评分分别达到 1935、1432 和 1506,全数夺得榜单第一,全面超越 Google、SAP 和 Amazon 等国际科技巨头的同类模型。

Elo 评分是衡量模型综合能力的核心排位指标。TabArena、BCCO 和 TALENT 覆盖分类、回归等多类表格建模任务,用以严格检验基础模型在多变数据集上的泛化水平与预测精度,已成为当前结构化数据大模型竞争的重要标尺。

此次 LimiX-2 的性能跃升,主要依靠三大核心技术创新的协同推进:
1. 上下文机制网络(CMNs):从“目标预测”迈向“结构发现”
传统先验拟合网络(PFNs)通常围绕预设的目标变量展开建模。LimiX-2 提出的上下文机制网络(Contextual Mechanism Networks,CMNs)打破了这一局限,将全变量间的联合依赖确立为建模核心,重点挖掘变量之间如何相互关联、构建了怎样的底层机制。
在预训练目标上,LimiX 引入上下文条件掩码建模(CCMM),在多观测模式下构建跨变量监督,使推断变量内在联系成为直接训练目标。在网络架构层面,模型采用单元格级(Cell-Level)建模,将单一变量观测作为基础单元,完整保留特征标识、具体数值与缺失状态,支持深度的跨样本与跨变量交互。在此框架下,分类、回归和缺失值填补等下游任务,统一转变为对同一基础模型的条件查询,为因果骨架的推断提供了扎实的统计支撑。
2. 自动化合成数据生成引擎全面升级
不同于易于从公开网络抓取的文本数据,高质量结构化数据大多沉淀在企业内部,获取门槛极高。为此,LimiX-2 升级了大规模数据合成引擎,能够全自动生成涵盖线性、非线性、多变量交互、周期变化以及噪声扰动等多种复杂分布的合成数据,让模型在实际进入工业场景前就充分吸收丰富的数据结构特征。
3. 参数拓展验证 Scaling Law
在前期发现“结构化数据基础模型遵循 Scaling Law”的基础之上,LimiX-2 将参数规模推升至 400M。参数扩增不仅验证了其架构的可扩展性,更在宏观维度赋予了模型更强的泛化能力,使隐蔽因果规律的挖掘更为稳定。
高维工业数据通常难以满足传统因果推断严苛的统计假设或对专家先验的依赖。LimiX-2 凭借联合关系建模能力,在 Sachs、UF 和 Causal Chamber 等多个权威因果发现公开数据集上,均取得了大幅优于传统统计方法的推断效果。

在落地应用端,上一代 LimiX 已在 800 多个结构化数据场景中完成通用性验证,并与 60 余家企业建立合作。它将过去“单一任务单独建模”的碎片化方案,整合为一个模型通识多场景的预测范式,广泛赋能工艺参数优化、设备故障预测、电力调度、能耗调优与材料研发等核心工业环节。

稳准智能首席科学家崔鹏教授指出,结构化数据基础模型同样在迎来属于自身的关键拐点。团队将持续推进因果智能的技术路线,深化模型对数据本质规律与内在因果的理解,推动工业 AI 快速从单一的“数据预测”进阶为可靠的“决策辅助”。
目前,LimiX-2 相关学术成果与模型资产已全面公开:
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断