开发者生态
morning
Meta 拓展自研芯片战略:从计算领域延伸至网络领域
2026-09-05
1 阅读
约4分钟阅读
作者: Matt Foster
字号:
Meta 详细介绍了 " MTIA 300,这是其首款专为训练排序和推荐模型而优化的自研加速器。 大语言模型训练往往主要关注原始浮点算力吞吐量——Meta 表示,与之不同的是,推荐模型在加速器之间的通信上花费了更多时间。MTIA 300 通过将网络和集合通信直接集成到芯片中来解决这一问题。 通信压力主要来自嵌入表,Meta 表示,嵌入表可能包含推荐模型 99% 以上的参数量。在数百个加速器上训练这些模型会产生频繁的 AllReduce、AllToAll 和 AllGather 操作,从而形成一种网络与计算本身同等重要的工作负载。 Meta 首先将网络接口移入加速器封装内部。MTIA 300 包含两个网络芯粒,每个芯粒配备六个定制的 800 Gbps RDMA NIC,提供总计 1.2 TB/s 的 I/O 带宽,且无需经过 PCIe 总线。这十二个 NIC 同时支持机架内的纵向扩展通信和机架间的横向扩展流量,让 Meta 能够在无需重新设计芯片的情况下调整带宽分配方式。 来源:Meta 将 NIC 移近计算端并未消除另一个资源争用问题:在传统 GPU 上,集合通信会占用训练任务本身所需的计算资源。而 MTIA 300 则配备了 16 个专用的消息引擎,独立于主计算网格处理通信,其中包括用于归约操作的近内存硬件。 Meta 表示,这种分离使得大型矩阵运算和集合通信能够并发运行,计算吞吐量仅下降不到 0.5%。而作为对比的 GPU 架构,在两类工作负载同时运行时,实测算力损耗超过 20%。 该硬件与 HCCL(Meta 的集合通信库)进行了协同设计。与在作业运行时由主机 CPU 编排每一次通信操作不同,HCCL 将集合操作编译为子图,MTIA 300 的消息引擎可以自主执行这些子图。一旦这些指令到达加速器,主机便不再参与驱动通信。 Meta 表示,在生产环境下,HCCL 在单个机架内可实现最高 940 GB/s 的通信带宽。针对一个部署在 40 个加速器上的 1500 亿参数推荐模型,MTIA 300 相比同等配置的 GPU 集群将总通信耗时降低至原来的 1/3.9(通信时间减少 3.9 倍)。 MTIA 300 也标志着 Meta 整体自研芯片项目的进一步扩张。Meta 表示,目前已经 部署数十万 " MTIA 加速器用于推理任务,并计划在未来两年推出四代后续产品,覆盖排序、推荐以及生成式 AI 各类工作负载。Meta 还扩大了与博通的合作,联合开发下一代 MTIA 芯片;同时仍会继续从 AMD、英伟达等厂商采购加速器,这就是 Meta 所谓的组合策略。 这一策略反映了超大规模云服务商正在普遍转向工作负载专用 AI 芯片。 谷歌 "持续扩展其 TPU 计划, 亚马逊 "不断壮大其 Trainium 业务,而 微软 "正在开发 Maia 加速器的后续代际产品,因为云服务商正在寻找替代方案,不再完全依赖通用 GPU。 MTIA 300 体现出 Meta 在芯片专用化这条道路上走得有多彻底。Meta 没有把网络视作加速器外围的配套基础设施,而是围绕一种“数据迁移与数据计算同等重要”的业务负载,将计算单元、通信硬件以及集合通信软件做一体化协同设计。 查看英文原文: https://www.infoq.com/news/2026/08/meta-hccl/ "
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱