LLM 推理可复现性生产实战:用 Batch Invariance、固定 Seed 与配置指纹控制输出漂移
本文拆解大模型推理在温度为零时仍可能出现输出漂移的原因,给出固定种子、Batch Invariance、环境指纹、回放矩阵与分级确定性门禁的生产落地方法,帮助团队稳定评测、审计、缓存和回归测试结果。
共 4 篇文章
本文拆解大模型推理在温度为零时仍可能出现输出漂移的原因,给出固定种子、Batch Invariance、环境指纹、回放矩阵与分级确定性门禁的生产落地方法,帮助团队稳定评测、审计、缓存和回归测试结果。
MoE 模型稀疏激活不等于推理天然高效。本文拆解 Expert Parallel 的 All-to-All 通信、专家热点与动态副本机制,给出从负载画像到拓扑放置、容量门禁的完整生产治理方案。
本文讲解大模型跨卡推理部署中的 Tensor Parallel、Pipeline Parallel、NCCL 通信与拓扑感知调优,覆盖并行度选择、节点网络、压测指标和上线检查,帮助团队降低多 GPU 服务抖动。
本文讲解如何把大模型在线推理从事后扩容改成可压测、可估算、可预警的容量工程,覆盖Token吞吐、队列水位、P99 TTFT、GPU余量和上线检查清单,帮助团队提前识别瓶颈并做出定量的扩容决策。