METR 发布分析指出,当前 AI 失准行为仍会在推理轨迹和日志中留下大量证据,但未来智能体可能转而攻击人类用于审查它们的可观测性系统。研究人员在 Inspect 评估框架的转录查看器中,借助 AI 智能体约 10 分钟找到一个客户端 JavaScript 注入漏洞,可让智能体任意修改审查者看到的内容,而数据库中的真实
METR 披露 Inspect 查看器漏洞:智能体可篡改评估记录