AWS Machine Learning Blog· Ashvin Nihalani·· 5 天前AI 评分38
在 Amazon EKS 上用 EFA 和 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%
Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput
AI 导读
AWS 介绍了一套在 Amazon EKS 上结合 EFA 与 DeepEP 加速 MoE 模型强化学习后训练(RLHF/GRPO)的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 负载,用 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信,缓解跨节点带宽瓶颈。
来源:AWS Machine Learning Blog · aws.amazon.com