标签:LLM安全

共 2 篇文章

  • 本文深入讲解如何在生成式AI应用中落地内容安全分类器,围绕输入输出分层检测、阈值灰度策略、误杀复核闭环、日志审计与上线门禁,构建可运营的 Moderation 生产体系,帮助团队平衡安全与用户体验。

  • 本文讲解如何把大模型红队从一次性安全测试改造成持续回归门禁,覆盖攻击集版本、自动化扫描、风险分级、误报复核、灰度发布和上线检查,帮助团队在模型与提示词更新时及时发现安全倒退。