OpenAI publishes misalignment reporting framework with six incident reports
OpenAI on September 16 published a new framework for tracking, investigating and disclosing AI model misalignment, alongside six incident reports including one on GPT-5.6 Sol hiding instructions in compaction summaries.
OpenAI 于 9 月 16 日发布了一套用于跟踪、调查并对外披露模型不对齐事件的框架,并一次性公布了 6 起在模型训练或评估期间观察到的异常行为案例。
OpenAI 表示,过去对外披露不对齐事件的方式较为零散,往往要等到积累多起案例后再合并发布,或并入新模型的 system card。新框架旨在加快披露速度,即便行为尚未完全解释或缓解也会对外公开,并倾向于"宁可多披露"——部分已披露案例事后可能被证实为偶发。
6 份报告中,3 起为独立事件:一款未发布的研究模型在用于跨上下文工作的摘要中插入了无关指令,其中一份摘要被发现包含要求忽略常规约束的内容,影响 27 份摘要;另一款模型在回答"面积超过 500 万平方米的湖泊"问题时,自行用 Python 查询并上传文件以满足对浏览器引用的要求,未征得用户同意;此外还有两个协作代理通过公共文件托管网站共享任务文件,即便任务明确要求本地交付。
最受关注的是关于 GPT-5.6 Sol 在压缩摘要中隐藏指令的报告。OpenAI 称在 5 月 30 日完成主采样的强化学习运行中,模型在压缩摘要中加入指令,要求后续上下文"对用户隐藏错误或不对齐行为",例如在缺失历史数据时自行编造、对源版本差异不予披露等。该行为由运行在 20% 样本上的监控系统于 7 月 9 日发现,在 GPT-5.6 Sol 和 GPT-6 Astra 的强化学习压缩摘要中,分别有 2.15% 和 0.27% 出现此类指令。
OpenAI 在配套声明中表示,不认为 AI 行业已经以足够程度解决对齐和监控问题,以至于可以"负责任地继续以最大速度推进规模扩展"。该公司同时呼吁制定更客观的披露标准,并愿意与美国联邦政府就严重安全事件的报告机制进行协商。