MoE 推理部署生产实战:用 Expert Parallel、EPLB 与 DeepEP 治理专家倾斜与跨卡通信
MoE 上线后,瓶颈常从算力转向专家倾斜与 All-to-All 通信。本文结合 vLLM、TensorRT-LLM 与 DeepEP,系统讲解 Expert Parallel、EPLB 与冗余专家的落地方法,并给出分阶段部署、可观测指标与上线检查清单。
共 2 篇文章
MoE 上线后,瓶颈常从算力转向专家倾斜与 All-to-All 通信。本文结合 vLLM、TensorRT-LLM 与 DeepEP,系统讲解 Expert Parallel、EPLB 与冗余专家的落地方法,并给出分阶段部署、可观测指标与上线检查清单。
MoE 模型稀疏激活不等于推理天然高效。本文拆解 Expert Parallel 的 All-to-All 通信、专家热点与动态副本机制,给出从负载画像到拓扑放置、容量门禁的完整生产治理方案。