LLM CUDA Graph 生产实战:用 Shape Bucket、分段捕获与 Eager 回退降低解码启动开销
大模型解码阶段 CPU Kernel Launch 开销常被忽视。本文深入讲解 CUDA Graph 捕获与重放机制,结合 Shape Bucket 设计、分段捕获、预热状态机和 Eager 回退策略,给出可落地的生产方案,帮助团队降低推理尾延迟与 P99 抖动。
共 2 篇文章
大模型解码阶段 CPU Kernel Launch 开销常被忽视。本文深入讲解 CUDA Graph 捕获与重放机制,结合 Shape Bucket 设计、分段捕获、预热状态机和 Eager 回退策略,给出可落地的生产方案,帮助团队降低推理尾延迟与 P99 抖动。
从生产推理角度拆解推测解码的收益边界,解释草稿模型、验证模型、接受率、请求负载与批处理之间的关系,并给出上线前的压测、回退和监控清单。