
Triton 为什么跑赢 CUDA:Meta 重写推荐系统嵌入算子的关键一步
Meta 把推荐系统最重的 TBE 算子从 CUDA 模板重写成 Triton,GB200 上 307 个生产分片的反向带宽中位数领先 13%~22%。收益大头不是编译器更聪明,而是把协作内核的切换点从段长 32 挪到 256——在 Triton 里这只是改一个配置值。
AI 咨询视角的深度分析与趋势解读

Meta 把推荐系统最重的 TBE 算子从 CUDA 模板重写成 Triton,GB200 上 307 个生产分片的反向带宽中位数领先 13%~22%。收益大头不是编译器更聪明,而是把协作内核的切换点从段长 32 挪到 256——在 Triton 里这只是改一个配置值。

NVIDIA 开源表格基础模型 Kumo Tabular:给一张带标签的表,一次前向传播直接预测新行,不训练、不调参、不做特征工程。全部用人造表预训练,在 TabArena 上 ELO 1950 排名第一,推理比 LimiX-2 快 17 倍。

AMD 以约 82 亿美元全股票收购李飞飞创办的 World Labs。按模型公司估值,这笔钱怎么算都不值;把它当成一份写给 2029 年芯片的负载说明书,才讲得通。英伟达买 Hugging Face 锁定现在,AMD 买 World Labs 下注未来——而中国缺的不是世界模型,是把未来负载写进芯片规格书的机制。

Liquid AI 把 DSpark 投机解码扩展到视觉语言模型,端侧解码最高提速 3.13 倍,但端到端最低只有 1.56 倍。用它自己的基准数据反推解码占比,能得到一条比「最高多少倍」有用得多的选型规则:收益由输出长度决定,不由草稿模型决定。
3分钟了解企业AI就绪水平,获取专属落地建议