Meta 详细介绍了首款专为训练排序和推荐模型而设计的自研加速器 MTIA 300:将 12 个 800 Gbps 定制 NIC 内嵌芯片封装,集合通信与矩阵计算并行执行,算力损耗不足 GPU 的 1/40。
Meta 公布了 MTIA 300 的详细设计,这是该公司首款专为训练排序和推荐模型而优化的自研加速器。与大语言模型训练主要追求原始浮点算力不同,推荐模型在加速器之间的通信上花费了更多时间——这是 MTIA 300 的出发点。
MTIA 300 将两个网络芯粒直接集成进加速器封装内部,每个芯粒配备 6 个定制 800 Gbps RDMA NIC,共计 12 个 NIC,提供 1.2 TB/s 的 I/O 带宽,无需经过 PCIe 总线。这 12 个 NIC 同时支持机架内的纵向扩展(scale-up)通信和机架间的横向扩展(scale-out)流量,Meta 可在不重新设计芯片的情况下动态调整带宽分配。
通信压力的根源在于嵌入表:推荐模型可能有 99% 以上的参数量存储在嵌入表中,在数百个加速器上训练时会产生频繁的 AllReduce、AllToAll 和 AllGather 操作。
传统 GPU 上,集合通信会占用训练计算所需的资源。MTIA 300 配备 16 个专用消息引擎,独立于主计算网格运行,包括用于归约操作的近内存硬件。
这种计算与通信的隔离,使得大型矩阵运算和集合通信可以并行执行。Meta 报告的实测结果:计算吞吐量损耗不足 0.5%,而 GPU 在两类工作负载同时运行时损耗超过 20%。
配套的 HCCL(Meta 集合通信库)将集合操作编译为子图,由 MTIA 300 的消息引擎自主执行——主机一旦将指令发送到加速器,便不再参与驱动通信。
Meta 已部署数十万 MTIA 加速器用于推理任务,计划在未来两年推出四代后续产品,覆盖排序、推荐及生成式 AI 工作负载,同时扩大与博通的芯片联合研发合作。
谷歌 TPU、亚马逊 Trainium、微软 Maia 均在走类似的「工作负载专用」路线,这一趋势是否加速英伟达的 GPU 市占变化,是值得关注的长线问题。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断