行业动态AWS Machine Learning Blog00:29
在Amazon EKS上使用EFA和DeepEP扩展MoE强化学习,吞吐量提升40%
Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput
专为大规模RLHF与GRPO团队设计,EKS配EFA才换来这40%吞吐提升
判断
做 MoE 强化学习训练的 Infra 负责人,现在不该把「EKS + EFA」写进下季度采购条款,而要先在自家 GRPO 任务上量一次 all-to-all 通信占比:那 40% 只在两者同时到位时才出现。
依据
AWS Machine Learning Blog 用一句标题给出结论:MoE 强化学习跑在 Amazon EKS 上,配 EFA(Elastic Fabric Adapter,把 GPU 机器直连、绕开 TCP/IP 栈的弹性网络适配器)和 DeepEP(DeepSeek 开源的 MoE 专家并行通信库),吞吐提升 40%。MoE(Mixture-of-Experts,混合专家)RL 的瓶颈常常不在算力而在专家并行的 all-to-all 通信:EFA 提供 RDMA 通路、DeepEP 负责压缩通信量、EKS 负责调度,三者缺一,标题里的 40% 就复现不出来。这也解释了策展句为什么强调「才换来」——换的是两件基础设施,不是一次框架升级。材料给到的可核对数字只有这一个 40%,没有基线吞吐、没有对比组、没有卡数。
没写清 材料没写基线吞吐、集群规模、GPU 型号和 DeepEP 版本号,所以这 40% 是相对谁、在多少卡上测出来的,都不能替它补。
下一步 等 AWS 放出基线配置,或自己复现:同一 GRPO 任务在不开 EFA 与只开 EFA 两种配置下各跑一次,看吞吐差是否仍为 40%。