LLM 权重量化上线生产实战:用 Calibration Set、FP8/W4A16 双轨基准与 Quality Gate 防止质量回退
大模型权重量化不能只看显存下降。本文结合 vLLM、LLM Compressor 与 TensorRT-LLM,给出校准集选择、FP8/W4A16 双轨基准、硬件匹配、质量门禁与灰度回滚的完整生产上线方法。
共 2 篇文章
大模型权重量化不能只看显存下降。本文结合 vLLM、LLM Compressor 与 TensorRT-LLM,给出校准集选择、FP8/W4A16 双轨基准、硬件匹配、质量门禁与灰度回滚的完整生产上线方法。
FP8 能降低大模型微调的算力与显存压力,但缩放策略、异常值和分布式同步处理不当会导致静默精度退化。本文给出 Amax 监控、层级白名单、BF16 回退、双轨评测与发布门禁的完整工程方案。