METR 公布对 Claude Opus 5.5 的部署前评估摘要,基于 10 个工作日 API 访问和五项任务测试,判断该模型在 AI 研发能力上较 Fable 5.1 属小幅提升,尚不足以完全自动化 AI 研发;同时估计其自身开发过程受到 AI 一定加速,但难以称得上大幅加速。
METR 发布 Claude Opus 5.5 部署前评估摘要