LLM 预训练数据去重生产实战:用 MinHash-LSH、语义去重与污染门禁降低记忆和评测泄漏
大模型预训练语料中的模板页、转载文和基准变体会放大记忆、浪费算力并污染评测。本文给出从精确去重、MinHash-LSH 到语义去重、基准隔离和阈值回放的完整上线方案,覆盖四层去重架构、工程流水线、阈值校准与常见误区。
持续沉淀可被搜索、可被引用、可长期复用的内容。共 155 篇,第 2 / 16 页。
大模型预训练语料中的模板页、转载文和基准变体会放大记忆、浪费算力并污染评测。本文给出从精确去重、MinHash-LSH 到语义去重、基准隔离和阈值回放的完整上线方案,覆盖四层去重架构、工程流水线、阈值校准与常见误区。
梯度累积看似只是把多个微批次相加,但变长样本、分布式同步、混合精度和学习率调度会悄悄改变等效批次。本文深入剖析 Token 归一化、DDP no_sync、AMP 更新边界与尾部窗口处理等生产级方案,帮助你在 LLM 微调中实现数学一致的梯度累积。
大模型训练中,激活值常比参数更早耗尽显存。本文深入探讨选择性重计算、非重入模式、随机数状态一致性及工程门禁策略,帮助团队在保证梯度正确的前提下降低峰值显存,控制训练吞吐损失。
FP8 能降低大模型微调的算力与显存压力,但缩放策略、异常值和分布式同步处理不当会导致静默精度退化。本文给出 Amax 监控、层级白名单、BF16 回退、双轨评测与发布门禁的完整工程方案。
模型合并能在不重新训练的情况下组合多个微调模型,但参数冲突、Tokenizer 不一致与能力互相覆盖会放大上线风险。本文讲清 TIES、DARE、校准集选权、制品指纹与回归门禁的生产方法。
本文详解 SFT 训练中如何通过 Sequence Packing 减少 Padding 浪费,结合样本边界隔离、Loss Mask、位置编号、长度分桶与回放门禁,避免跨样本注意力污染与训练标签串样,实现安全高效的变长训练。
面向流式大模型应用,系统讲解网络字节、API Delta 与用户可见字符三层边界,给出增量 UTF-8 解码、扩展字素簇缓冲、NFC 归一化及回放测试方案,避免乱码、Emoji 拆分和索引失配。
分布式微调真正危险的不是保存慢,而是恢复后训练状态悄悄漂移。本文围绕分片检查点、原子提交、优化器与随机状态恢复、World Size 变更及故障演练,给出可验证的生产方案。
只给 GPU 设置 Power Cap,往往忽略 Prefill 与 Decode 的负载差异。本文讲解如何用分阶段时钟、每 Token 能耗和热降频门禁,在不破坏延迟 SLO 的前提下治理推理能效。
分布式大模型推理发生 NCCL 集体通信卡死时,往往只剩模糊的超时日志。本文介绍如何用 RAS、Flight Recorder、拓扑基线和异常 Rank 定位,建立可观测、可回滚的通信上线门禁。