LLM 知识蒸馏生产实战:用 Teacher Logprob 契约、On-policy 回放与 Top-K Tail Bucket 控制学生模型退化
面向大模型知识蒸馏上线,系统说明教师 Logprob 契约、温度与散度选择、On-policy 回放、Top-K 尾部概率桶、Tokenizer 对齐及学生能力回归门禁,避免蒸馏后静默退化与上线翻车。
共 8 篇文章
面向大模型知识蒸馏上线,系统说明教师 Logprob 契约、温度与散度选择、On-policy 回放、Top-K 尾部概率桶、Tokenizer 对齐及学生能力回归门禁,避免蒸馏后静默退化与上线翻车。
同一模型、同一提示词和相同随机种子仍可能产生不同输出。本文从采样状态、动态批次、浮点归约、并行拓扑和版本指纹出发,给出可复现推理的分级目标、实现方案、回放门禁与上线检查清单。
FP8 能降低大模型微调的算力与显存压力,但缩放策略、异常值和分布式同步处理不当会导致静默精度退化。本文给出 Amax 监控、层级白名单、BF16 回退、双轨评测与发布门禁的完整工程方案。
模型合并能在不重新训练的情况下组合多个微调模型,但参数冲突、Tokenizer 不一致与能力互相覆盖会放大上线风险。本文讲清 TIES、DARE、校准集选权、制品指纹与回归门禁的生产方法。
本文拆解大模型推理在温度为零时仍可能出现输出漂移的原因,给出固定种子、Batch Invariance、环境指纹、回放矩阵与分级确定性门禁的生产落地方法,帮助团队稳定评测、审计、缓存和回归测试结果。
当模型供应商更新、内部微调或提示词升级时,线上行为可能悄悄漂移。本文从影子流量、兼容门禁、金丝雀指标、版本登记和自动回滚讲清 LLM 灰度发布的工程做法,帮助团队构建面向行为兼容性的发布链路。
本文讲解如何把大模型微调数据集纳入版本治理,覆盖样本血缘、训练测试拆分、评测门禁、实验追踪、回滚与上线检查,避免 SFT 因脏数据、偏置样本或错误标注导致能力退化。
本文讲解大模型模型制品从下载、签名、扫描到上线准入的供应链治理方法,覆盖 safetensors、来源校验、SBOM、灰度放行和事故回滚,帮助团队降低权重污染风险,适合开源模型与内部模型仓库落地。