多模态 LLM Serving 生产实战:用 Parallel Media Decode、Encoder Cache 与 Encoder Disaggregation 压住视觉请求尾延迟
多模态大模型上线后,视觉请求的尾延迟往往被图片下载、解码、视觉编码与重复处理拖高。本文结合 Dynamo、vLLM 与 EPD 实践,给出媒体解码前移、Encoder Cache、独立 Encoder Worker、输入预算和阶段级观测指标的生产治理方法。
共 1 篇文章
多模态大模型上线后,视觉请求的尾延迟往往被图片下载、解码、视觉编码与重复处理拖高。本文结合 Dynamo、vLLM 与 EPD 实践,给出媒体解码前移、Encoder Cache、独立 Encoder Worker、输入预算和阶段级观测指标的生产治理方法。