LLM 梯度累积生产实战:用 Token-Normalized Loss、DDP no_sync 与 Scheduler 对齐避免等效批次失真
梯度累积看似只是把多个微批次相加,但变长样本、分布式同步、混合精度和学习率调度会悄悄改变等效批次。本文深入剖析 Token 归一化、DDP no_sync、AMP 更新边界与尾部窗口处理等生产级方案,帮助你在 LLM 微调中实现数学一致的梯度累积。
持续沉淀可被搜索、可被引用、可长期复用的内容。共 172 篇,第 4 / 18 页。
梯度累积看似只是把多个微批次相加,但变长样本、分布式同步、混合精度和学习率调度会悄悄改变等效批次。本文深入剖析 Token 归一化、DDP no_sync、AMP 更新边界与尾部窗口处理等生产级方案,帮助你在 LLM 微调中实现数学一致的梯度累积。
大模型训练中,激活值常比参数更早耗尽显存。本文深入探讨选择性重计算、非重入模式、随机数状态一致性及工程门禁策略,帮助团队在保证梯度正确的前提下降低峰值显存,控制训练吞吐损失。
FP8 能降低大模型微调的算力与显存压力,但缩放策略、异常值和分布式同步处理不当会导致静默精度退化。本文给出 Amax 监控、层级白名单、BF16 回退、双轨评测与发布门禁的完整工程方案。
模型合并能在不重新训练的情况下组合多个微调模型,但参数冲突、Tokenizer 不一致与能力互相覆盖会放大上线风险。本文讲清 TIES、DARE、校准集选权、制品指纹与回归门禁的生产方法。
本文详解 SFT 训练中如何通过 Sequence Packing 减少 Padding 浪费,结合样本边界隔离、Loss Mask、位置编号、长度分桶与回放门禁,避免跨样本注意力污染与训练标签串样,实现安全高效的变长训练。
面向流式大模型应用,系统讲解网络字节、API Delta 与用户可见字符三层边界,给出增量 UTF-8 解码、扩展字素簇缓冲、NFC 归一化及回放测试方案,避免乱码、Emoji 拆分和索引失配。
分布式微调真正危险的不是保存慢,而是恢复后训练状态悄悄漂移。本文围绕分片检查点、原子提交、优化器与随机状态恢复、World Size 变更及故障演练,给出可验证的生产方案。
只给 GPU 设置 Power Cap,往往忽略 Prefill 与 Decode 的负载差异。本文讲解如何用分阶段时钟、每 Token 能耗和热降频门禁,在不破坏延迟 SLO 的前提下治理推理能效。
分布式大模型推理发生 NCCL 集体通信卡死时,往往只剩模糊的超时日志。本文介绍如何用 RAS、Flight Recorder、拓扑基线和异常 Rank 定位,建立可观测、可回滚的通信上线门禁。
实时语音应用的难点不只是模型准确率。本文从音频格式契约、VAD 分段策略、Partial 与 Final 状态对账、时间戳回放到真实噪声评测,系统拆解如何构建可观测、可回滚的低延迟语音识别管线,适合 LLM、生成式 AI 与实时 Agent 技术读者。