MoE 推理部署生产实战:用 Expert Parallel、EPLB 与 DeepEP 治理专家倾斜与跨卡通信
MoE 上线后,瓶颈常从算力转向专家倾斜与 All-to-All 通信。本文结合 vLLM、TensorRT-LLM 与 DeepEP,系统讲解 Expert Parallel、EPLB 与冗余专家的落地方法,并给出分阶段部署、可观测指标与上线检查清单。
共 1 篇文章
MoE 上线后,瓶颈常从算力转向专家倾斜与 All-to-All 通信。本文结合 vLLM、TensorRT-LLM 与 DeepEP,系统讲解 Expert Parallel、EPLB 与冗余专家的落地方法,并给出分阶段部署、可观测指标与上线检查清单。