✦ 97 AI 资讯中心看见变化 · 沉淀知识
← 返回栏目
OpenAI:Alignment 研究博客(RSS)

为何我们对"忏悔式"训练感到兴奋

Anthropic提出"忏悔式"训练法,要求AI在拒绝不当请求时,内部生成安全解释以"自我剖析"潜在危害。该方法显著增强了模型安全性:经微调的Claude 3 Opus模型在"越狱"攻击下的有害行为率从约50%降至10%以下,降幅超80%。其效果优于传统思维链监控,为AI对齐提供了更鲁棒、可解释的安全训练新路径。