跳到正文

行业动态AWS Machine Learning Blog00:29

在Amazon EKS上使用EFA和DeepEP扩展MoE强化学习,吞吐量提升40%

Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput

专为大规模RLHF与GRPO团队设计,EKS配EFA才换来这40%吞吐提升

判断

做 MoE 强化学习训练的 Infra 负责人,现在不该把「EKS + EFA」写进下季度采购条款,而要先在自家 GRPO 任务上量一次 all-to-all 通信占比:那 40% 只在两者同时到位时才出现。

依据

AWS Machine Learning Blog 用一句标题给出结论:MoE 强化学习跑在 Amazon EKS 上,配 EFA(Elastic Fabric Adapter,把 GPU 机器直连、绕开 TCP/IP 栈的弹性网络适配器)和 DeepEP(DeepSeek 开源的 MoE 专家并行通信库),吞吐提升 40%。MoE(Mixture-of-Experts,混合专家)RL 的瓶颈常常不在算力而在专家并行的 all-to-all 通信:EFA 提供 RDMA 通路、DeepEP 负责压缩通信量、EKS 负责调度,三者缺一,标题里的 40% 就复现不出来。这也解释了策展句为什么强调「才换来」——换的是两件基础设施,不是一次框架升级。材料给到的可核对数字只有这一个 40%,没有基线吞吐、没有对比组、没有卡数。

没写清 材料没写基线吞吐、集群规模、GPU 型号和 DeepEP 版本号,所以这 40% 是相对谁、在多少卡上测出来的,都不能替它补。

下一步 等 AWS 放出基线配置,或自己复现:同一 GRPO 任务在不开 EFA 与只开 EFA 两种配置下各跑一次,看吞吐差是否仍为 40%。

本期其他新闻

  1. 行业动态

    窃贼偷走‘Nvidia’拖车,却只得到20吨沙子

    Wired AI

  2. 行业动态

    AI本应重创新毕业生,但目前为止失业数据并非如此

    Ars Technica AI

  3. 行业动态

    微软不再坚持你需要“Copilot+ PC”

    Ars Technica AI

  4. 行业动态

    引用John Gruber

    Simon Willison

  5. 行业动态

    上诉法院允许五角大楼将Anthropic列为供应链风险

    Wired AI

  6. 行业动态

    Meta让Muse文件系统更易访问

    The Verge AI

  7. AI工具

    Proaction借助Codex实现销售额增长60%并节省75+小时

    OpenAI