LLM 分布式推理通信故障治理:用 NCCL RAS、Flight Recorder 与拓扑基线定位集体通信卡死
分布式大模型推理发生 NCCL 集体通信卡死时,往往只剩模糊的超时日志。本文介绍如何用 RAS、Flight Recorder、拓扑基线和异常 Rank 定位,建立可观测、可回滚的通信上线门禁。
共 4 篇文章
分布式大模型推理发生 NCCL 集体通信卡死时,往往只剩模糊的超时日志。本文介绍如何用 RAS、Flight Recorder、拓扑基线和异常 Rank 定位,建立可观测、可回滚的通信上线门禁。
在多租户微调服务中,LoRA Adapter 数量、版本与租户数持续增长,单纯全量预加载已不可行。本文从 Adapter Registry、热度分层、冷启动预算、驱逐策略到上线检查,系统讲解如何构建生产级 Adapter 缓存治理体系,帮助团队在共享基础模型池中稳定服务大量定制模型。
从多租户推理场景出发,系统讲解 Multi-LoRA 服务中的适配器缓存、冷热分层、Rank 感知调度、驱逐策略和上线检查方法,帮助团队在 GPU 显存约束下稳定服务海量定制化 LoRA 适配器。
本文系统讲解 Continuous Batching 如何通过迭代级调度提升 LLM 推理吞吐,覆盖静态批处理痛点、调度机制、KV Cache 约束、关键参数配置、监控指标与上线误区,适合推理服务优化与容量规划参考。