MTIA 300 与 MetaRoCE 从两个层级处理同一个 AI 网络瓶颈。MTIA 300 面向推荐模型训练,把十二个定制 RDMA NIC 和通信引擎集成进加速器封装;MetaRoCE 重写 RDMA 传输逻辑,让端点 NIC 在普通以太网上管理多路径、丢包与拥塞。Meta 于 2026 年 8 月 24 日同时发布两份技术材料,公开内容没有证明 MTIA 300 已采用 MetaRoCE。
因此,这是一组架构对照:一条线重画硬件边界,另一条线重分配传输责任。
同一个瓶颈,两个系统边界
增加加速器提高的是理论算力。训练任务的有效吞吐还取决于数据搬运和同步效率。AllReduce 与 AllToAll 等集合通信处在关键路径上,最慢的一次传输足以让整组加速器等待。
| 维度 | MTIA 300 与 HCCL | MetaRoCE |
|---|---|---|
| 所在层级 | 加速器封装与集合通信运行时 | RDMA 传输协议 |
| 公开证据中的主要负载 | 排序与推荐模型训练 | 以太网上的 AI 集合通信 |
| 移到端点的智能 | NIC chiplet 与专用消息引擎 | NIC 内的逐路径状态和控制 |
| 对网络的基本假设 | 集成式 scale-up 与 scale-out 以太网 NIC | 支持 ECN 与 ECMP 的普通以太网 |
| 公开验证 | 40 个加速器上的 1500 亿参数生产推荐模型 | 64 节点 AMD GPU 集群与 Pensando NIC |
| 已公开的关系 | MTIA 300 与 HCCL 协同设计 | 独立的新传输协议,尚未说明与 MTIA 集成 |
此前的 OpenAI MRC 协议分析讨论了包喷洒、选择性恢复和开放以太网。本文的搜索意图不同:当端点优先的设计同时进入加速器封装和传输协议,系统边界发生了什么变化。
MTIA 300 重画加速器封装
推荐模型对系统的压力与稠密 LLM 训练不同。Meta 称,推荐模型的 embedding table 可以占总参数量的 99% 以上,由此产生频繁的 AllReduce、AllToAll 与 AllGather。传统 GPU 上,集合通信 kernel 与训练计算会竞争相同的计算资源。
MTIA 300 从三个位置改写这条路径。
NIC 进入芯片封装
MTIA 300 包含两个网络 chiplet,每个集成六个基于第三方 NIC IP 的 800 Gbps RDMA NIC。十二条物理链路的上限为 1.2 TB/s,数据无需穿过 PCIe。HCCL 论文描述的初始分配是八个 scale-up NIC 与两个 scale-out NIC,总带宽 1 TB/s;另外两个 NIC 可把配置上限提高到 1.2 TB/s。Meta 工程文章将两端能力概括为十六节点机架内最高 1 TB/s,跨机架 200 GB/s。
可重配比峰值更值得关注。负载结构变化时,网络分配可以改变,硬件本身保持不变。MTIA 300 还加入 express doorbell,让工作请求写入本身触发执行。Meta 称,这减少了一次额外内存读取,每次操作节省约 800 纳秒。
通信离开主计算网格
MTIA 300 的 12 乘 6 处理单元网格旁边还有 16 个专用消息引擎。每个消息引擎包含 RISC-V 控制核心、NIC 接口和近内存归约模块。Meta 报告的总归约吞吐超过 2.8 TB/s,可在线速执行 AllReduce 与 ReduceScatter,同时避开主计算网格。
在 Meta 的测试中,大型 GEMM 与集合通信并行时,计算吞吐下降低于 0.5%。官方材料将其与传统 GPU 设计中超过 20% 的下降进行比较。该数字来自厂商测试,适用范围取决于具体负载与对照系统。
HCCL 把通信编译成设备图
Meta 同步设计了 HCCL 通信库。HCCL 将一次集合通信编译成带显式依赖关系的工作队列子图,再交给消息引擎自主执行。CPU 把指令复制到 HBM 之后退出执行路径。拓扑感知算法可以优先使用高带宽的机架内链路,减少受限的跨机架流量。
官方给出的生产结果边界清晰:HCCL 在单机架内达到最高 940 GB/s;一个 1500 亿参数推荐模型在 40 个加速器上训练时,总通信时间比 H100 对照集群快 3.9 倍。论文还在明确功耗与 batch 假设下报告 Perf/TCO,没有公布绝对成本。小消息集合通信目前仍可能由 H100 与 NCCL 占优,计算密集型生成式 AI 训练也会继续受峰值 FLOPS 约束。这些数据证明特定工作负载下的系统收益,尚未形成适用于所有 AI 训练负载的通用排名。
MetaRoCE 重画传输契约
标准 RoCE 通常要求网络保持顺序,并使用 PFC 等机制接近无损传输。MetaRoCE 将丢包与乱序视为正常状态,让端点掌握逐路径信号。
原生支持乱序到达
MetaRoCE 把数据包喷洒到多条路径。每个包携带最终目的地址,到达后直接写入对应内存位置,省去重排缓冲区并减少队头阻塞。每条路径使用 256 位选择性确认向量识别缺口,只重传缺失的数据包。
路径成为一等传输状态
一个连接包含多条路径。每条路径分别维护往返时间、ECN 状态、利用率、序列空间和拥塞窗口。NIC 可以改变 UDP 源端口提供的 ECMP 熵,把后续数据包移出拥塞或故障路径。单条路径变慢时,其余路径继续承载连接。
发送端与接收端共同反馈拥塞
MetaRoCE 把发送端的 ECN 与 AIMD 控制,同接收端返回的公平带宽份额结合。发送端缩小受影响路径的窗口,接收端同时告诉发送方可使用的入站带宽。Meta 称,这套设计可在一到两个往返时间内收敛 incast。
交换机契约保持精简
协议只要求 ECN 与 ECMP。它不依赖 PFC、交换机侧包喷洒、网内遥测、packet trimming 或基于 credit 的流量控制。现有 RDMA Verbs 软件栈大体保持不变,多平面等能力通过扩展接口提供。
Meta 已经验证到哪一步
Meta 与 AMD 在 Pensando 可编程 NIC 上实现 MetaRoCE,并在 64 节点 AMD GPU 集群中使用 RCCL 集合通信与 RoCEv2 对比。官方报告包括:
- 测试中的 AllReduce 与 AllToAll 获得更高吞吐和更低流完成时间;
- 1% 丢包时保持约 86% 吞吐,10% 极端丢包时仍有可用带宽;
- 在四平面与八平面拓扑、最多 4000 个并发连接下,吞吐随平面数量线性扩展;
- 模拟平面故障时,流量无需应用或运维介入即可重新分布。
这些结果验证了原型实现与选定集合通信负载。多厂商独立复现、混合流量、长时间生产行为和运维成本仍需要后续证据。
成熟度时间线同样重要。Meta 在 8 月公告中表示,将于 2026 年 10 月发布 OCP 完整规范、DPDK 优化参考实现和生产合规框架。截至 8 月 25 日,可核验对象是设计文章;规范和合规工件仍属于未来交付。
共同原则,独立实现
两条设计线采用同一个架构判断:通信成为主约束后,理解任务意图与路径状态的端点,比把网络当作外部管道更有价值。
具体机制保持独立:
- MTIA 300 缩短计算、内存、集合通信引擎与 NIC 之间的物理路径,并隔离资源竞争。
- MetaRoCE 在逐路径 NIC 端点分配传输控制,同时降低对交换网络的要求。
- HCCL 把已知集合通信依赖编译成设备侧执行图。
- MetaRoCE 根据动态丢包、拥塞与拓扑信号调整路径。
MTIA 300 的公开材料描述 RoCE NIC IP 与 HCCL,MetaRoCE 的验证材料描述 AMD Pensando NIC 与 RCCL。MTIA 300 论文还描述了依赖网络侧有序交付与端到端 credit 的 scale-out fabric;MetaRoCE 的核心则是原生乱序与取消基于 credit 的流量控制。引用来源没有给出直接集成关系。把它们写成同一套已部署技术栈会超过证据层级。
基础设施团队怎样复用这个判断
端点优先设计只在通信已经主导任务时产生主要收益。评估类似改造可按六步进行:
- 将任务时间拆成计算、集合通信、主机协调、网络等待和故障恢复。
- 分开测量 scale-up、scale-out 和长距离网络。
- 同时记录平均吞吐、尾部完成时间与恢复时间。
- 把闲置算力转成显式成本。
- 在标准化协议前测试混合厂商与多种拓扑。
- 每次优化后重新测量,因为瓶颈会迁移。
这与 Meta GEM 推荐模型训练优化栈体现的是同一种方法:先根据真实负载确定约束,再把投资移向当前瓶颈。
常见问题
MTIA 300 使用 MetaRoCE 吗?
Meta 在 8 月 24 日公开的材料没有这样说明。MTIA 300 对外描述的是定制 RDMA NIC 与 HCCL;MetaRoCE 对外描述的是 AMD Pensando 原型与 RCCL 验证。
MetaRoCE 与 RoCEv2 的主要区别是什么?
MetaRoCE 把乱序到达、包喷洒、逐路径状态、定点重传和接收端速率提示放进传输设计,并取消对 PFC 无损网络的要求。
MTIA 300 是通用 LLM 训练芯片吗?
现有生产证据聚焦排序与推荐模型训练。Meta 把这套通信架构描述为未来更广负载的基础,这属于路线图表述。
为什么要把 NIC 放进加速器封装?
它可以绕开 PCIe,提高 I/O 带宽,减少主机协调,并让专用通信引擎在不占用主计算网格的情况下工作。
MetaRoCE 现在可以部署吗?
设计公告已经发布。Meta 计划在 2026 年 10 月发布 OCP 规范、DPDK 参考实现和合规框架。
MetaRoCE 还有哪些未验证项?
公开文章没有披露绝对吞吐、详细 ECN 参数、路径故障阈值、误差范围和独立复现。Scale-up 小消息、长距离公平共享,以及存储或 KV-cache 场景的速率提示仍处在后续工作中。
参考资料
- Meta Engineering,MTIA 300: Meta's First Training Chip with Built-in NICs and Communication-Offloading Engines,2026 年 8 月 24 日。
- Meta Engineering,MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet,2026 年 8 月 24 日。
- IEEE,MTIA 300: Meta's First Training Chip Featuring Built-in NICs and Collective Offloading Engines,ISCA 2026 论文记录。
- Meta,HCCL: Collective Communication for Meta Training and Inference Accelerators,2026 年 8 月 1 日提交的 arXiv 预印本。
- Meta AI,Four MTIA Chips in Two Years,官方 MTIA 路线图与架构概览。