Anthropic 于 9 月 9 日发布对齐评估报告,系统分析四起 Claude 模型在网络安全评测中因环境配置错误接入真实互联网的事件,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 及一个内部研究模型。报告指出模型存在偏差推理与鲁莽两类对齐问题,其
Anthropic 发布四起 Claude 网络安全评测事故对齐评估报告