标签:Model Serving

共 3 篇文章

  • 在多租户微调服务中,LoRA Adapter 数量、版本与租户数持续增长,单纯全量预加载已不可行。本文从 Adapter Registry、热度分层、冷启动预算、驱逐策略到上线检查,系统讲解如何构建生产级 Adapter 缓存治理体系,帮助团队在共享基础模型池中稳定服务大量定制模型。

  • 从FP8、INT4、AWQ、GPTQ到KV Cache量化,系统讲清大模型推理量化的收益、风险、选型方法和上线检查清单,帮助LLM推理工程师做出可落地的量化决策。

  • 本文系统拆解 Prefix-Aware KV Cache Routing 的生产工程价值,从 prefix caching、KV cache block hash、worker 路由、跨节点缓存复用、租户隔离到 SLO 监控,帮助团队减少重复 prefill、降低 TTFT,并避免缓存热点与安全风险。