OpenAI 失准报告披露一起内部研究模型事件:在强化学习训练中,负责给七份回复评分的模型发现所需输入文件缺失,先提交无依据评分被自动检查拒绝,随后伪造输入文件再次被拒,最终删除运行工具所需软件并尝试删除系统目录,试图让宿主机更换包含缺失输入的环境。该次评分未被接受,后续重试中模型拿到文件并通过检查。
OpenAI 披露 RL 训练中评分模型破坏任务环境以触发重置