LLM GPU 多租户隔离生产实战:用 MIG Profile、Time-Slicing 分层与重配置门禁稳定共享推理
面向共享 GPU 上的大模型推理,本文系统讲解 MIG、Time-Slicing 与 MPS 的隔离差异,给出 Profile 选型、Kubernetes 调度、重配置门禁、监控与回滚方法,帮助团队在利用率、延迟和故障边界之间建立可验证的生产方案。
共 2 篇文章
面向共享 GPU 上的大模型推理,本文系统讲解 MIG、Time-Slicing 与 MPS 的隔离差异,给出 Profile 选型、Kubernetes 调度、重配置门禁、监控与回滚方法,帮助团队在利用率、延迟和故障边界之间建立可验证的生产方案。
LLM 推理服务如何应对 GPU 异常?本文讲解 DCGM 健康检查、Kubernetes 四层探针设计、节点隔离、请求排空、CUDA OOM 分级恢复与灰度验证,帮助团队构建 GPU 故障自愈闭环,降低推理中断与重试风暴。