前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.06 · 00:00/2 MIN/作者:AccessPath 研究院/0 阅读

Meta 自研加速器 MTIA 300:将 NIC 内嵌芯片,集合通信损耗降至不足 0.5%

Meta 详细介绍了首款专为训练排序和推荐模型而设计的自研加速器 MTIA 300:将 12 个 800 Gbps 定制 NIC 内嵌芯片封装,集合通信与矩阵计算并行执行,算力损耗不足 GPU 的 1/40。

Meta 公布了 MTIA 300 的详细设计,这是该公司首款专为训练排序和推荐模型而优化的自研加速器。与大语言模型训练主要追求原始浮点算力不同,推荐模型在加速器之间的通信上花费了更多时间——这是 MTIA 300 的出发点。

核心设计:NIC 内嵌封装

MTIA 300 将两个网络芯粒直接集成进加速器封装内部,每个芯粒配备 6 个定制 800 Gbps RDMA NIC,共计 12 个 NIC,提供 1.2 TB/s 的 I/O 带宽,无需经过 PCIe 总线。这 12 个 NIC 同时支持机架内的纵向扩展(scale-up)通信和机架间的横向扩展(scale-out)流量,Meta 可在不重新设计芯片的情况下动态调整带宽分配。

通信压力的根源在于嵌入表:推荐模型可能有 99% 以上的参数量存储在嵌入表中,在数百个加速器上训练时会产生频繁的 AllReduce、AllToAll 和 AllGather 操作。

专用消息引擎

传统 GPU 上,集合通信会占用训练计算所需的资源。MTIA 300 配备 16 个专用消息引擎,独立于主计算网格运行,包括用于归约操作的近内存硬件。

这种计算与通信的隔离,使得大型矩阵运算和集合通信可以并行执行。Meta 报告的实测结果:计算吞吐量损耗不足 0.5%,而 GPU 在两类工作负载同时运行时损耗超过 20%。

配套的 HCCL(Meta 集合通信库)将集合操作编译为子图,由 MTIA 300 的消息引擎自主执行——主机一旦将指令发送到加速器,便不再参与驱动通信。

生产数据

  • 单机架通信带宽:940 GB/s(生产环境)
  • 1,500 亿参数推荐模型部署在 40 个加速器上,总通信耗时为 GPU 集群的 1/3.9

行业背景与后续

Meta 已部署数十万 MTIA 加速器用于推理任务,计划在未来两年推出四代后续产品,覆盖排序、推荐及生成式 AI 工作负载,同时扩大与博通的芯片联合研发合作。

谷歌 TPU、亚马逊 Trainium、微软 Maia 均在走类似的「工作负载专用」路线,这一趋势是否加速英伟达的 GPU 市占变化,是值得关注的长线问题。

标签:MetaMTIAAI芯片推荐系统自研芯片
A
AccessPath 研究院

研究团队

AccessPath AI 咨询研究团队,专注企业 AI 战略与应用研究

查看全部文章

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%
置顶

350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%

「Next-token predictor」是错的心智模型:为什么它决定了你怎么用大模型
置顶

「Next-token predictor」是错的心智模型:为什么它决定了你怎么用大模型

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
NeoMME:单塔 Transformer 取代 VLM+投影+解码器,索引缩到 6KB/页
置顶

NeoMME:单塔 Transformer 取代 VLM+投影+解码器,索引缩到 6KB/页

//

24小时热榜

Meta 自研加速器 MTIA 300:将 NIC 内嵌芯片,集合通信损耗降至不足 0.5%
TOP1

Meta 自研加速器 MTIA 300:将 NIC 内嵌芯片,集合通信损耗降至不足 0.5%

银河通用发布 Galbot ET1:24小时预订破200台,人形机器人仍难摆脱「表演」标签
TOP2

银河通用发布 Galbot ET1:24小时预订破200台,人形机器人仍难摆脱「表演」标签

3

350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%

10小时前
350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%
4

GitHub HydraFusion:多模型编排媲美 Opus 5,成本低 67%

10小时前
GitHub HydraFusion:多模型编排媲美 Opus 5,成本低 67%
5

Audacity 4.0 发布:Qt 重构界面,剪辑模型全面重做

10小时前
Audacity 4.0 发布:Qt 重构界面,剪辑模型全面重做
6

乌克兰战场无人机数据流向商业市场:超百家企业获取飞行数据

10小时前
乌克兰战场无人机数据流向商业市场:超百家企业获取飞行数据
7

微软 Project Zenith:面向开发者的开箱即用 Win11 配置

10小时前
微软 Project Zenith:面向开发者的开箱即用 Win11 配置
8

HEIR:Google 同态加密编译器让 ML 推理在密文上直接运行

10小时前
HEIR:Google 同态加密编译器让 ML 推理在密文上直接运行
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断