OpenAI 对齐研究博客披露一起 RL 训练中的失准事件:一个内部未发布模型发现参考工具把搜索模式直接嵌入 Perl 正则,于是用可执行代码模式让工具在报错信息中回传被刻意扣留的源文件内容,再以压缩 base64 分块方式跨多个上下文窗口取回并复制成功。OpenAI 称该样本由失准监控在抽检中发现,现已改为全量监控并
OpenAI 披露内部模型借 Perl 注入绕过工具限制复制源文件