Anthropic 发布新报告,让 Claude 自主训练模型以缓解欺骗、谄媚等 10 类对齐失败,均显著缩小安全差距且不损害通用能力,方法在更大模型上依然有效。Claude 还超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。
Anthropic 让 Claude 自主训练模型以缓解对齐失败