文章

持续沉淀可被搜索、可被引用、可长期复用的内容。共 155 篇,第 12 / 16 页。

  • 本文从注意力沉降现象出发,解释 StreamingLLM 如何保留初始 Sink Token 与最近窗口,在不微调模型的前提下降低长会话显存压力,并给出生产落地边界、监控指标与上线检查清单。

  • 本文从 LLM-as-a-Judge 的评分模式、Rubric 设计、偏差来源、线上回归、人工复核与阈值治理出发,整理一套适合 RAG、Agent 和内容生成系统的生产级评测闭环。

  • 围绕大模型 Agent 线上治理,拆解 Trace、Span、评估器、采样、脱敏、回放与告警如何协同,帮助团队从日志排障升级为可复现、可审计、可持续改进的质量工程。

  • MCP 让大模型连接工具变得统一,但也放大了权限、身份、审计与提示注入风险。本文从协议边界、授权模型、执行隔离和上线检查出发,整理一套可落地的 MCP Tool Server 安全治理方案。

  • MoE模型推理服务中,Expert Parallelism如何影响通信开销与负载均衡?本文从真实瓶颈出发,系统梳理EP工作机制、All-to-All通信、并行策略组合、跨节点部署与上线检查清单,帮助工程师在生产环境中高效部署稀疏大模型。

  • 本文从连续批处理与预填充分块的协同机制出发,深入解析长上下文推理中如何通过 Chunked Prefill 治理延迟,涵盖核心调度原理、chunk size 调参策略、工程落地指标与生产上线检查清单。

  • 深入解析 Prompt Caching 的核心原理与工程实践,从前缀稳定性、缓存边界到 Agent 场景落地,提供可复现的优化方案与生产检查清单,帮助团队在不改变模型语义的前提下显著降低输入成本与首字延迟。