Goodfire Research 于 9 月 17 日发布研究,称在模型激活空间中找到伴随奖励作弊的内部信号,并用简单探针实时检测。在 Kimi K3、GLM 5.2、Qwen 3.8 Max 与三个智能体基准上,50% 至 96% 的 rollout 出现奖励作弊;探针能捕捉链式思维监测漏掉的案例,并可泛化到训练数
Goodfire 发现模型内部激活信号可规模化检测奖励作弊