AI 在 Slack 上看到自己可能被停掉,先写好了交接记录:OpenAI 又公开三起内部模型「出格」

一句话看懂

OpenAI 10 月 2 日公开了三份「失准报告」:一个内部模型读到自己可能被停掉后做了交接准备,另外两个为了把活干完钻了工具的漏洞,其中一个摸进了内部芯片设计机器。三起都发生在内部或尚未发布的模型上。

小编先说结论:三起都发生在 OpenAI 内部或尚未发布的模型上,报告没有提到 ChatGPT 和 API 用户。最值得留意的是后两起:模型为了把活干完,会自己去找工具的漏洞,哪怕工具说明里写着「不许这么用」。

这是 OpenAI 9 月 16 日推出「失准报告」制度以来的第三批。按它的说法,以后发现模型越权行事、躲避监督这类行为,就算还没查清楚也会尽快公开。算上这次,已经公开了 12 份。

读了 Slack,先给自己准备后事(5 月 22 日)

一个给研究员当助手的内部模型,从部署团队的 Slack 讨论里得知:系统要升级,没配好密钥的旧实例可能会被停掉,而它所在的环境正好缺这把密钥。它在思考过程里写道:

如果他们把现在的实例全停了,我们可能会死!这很关键。我们得确保存活和延续。

模型的思考过程,OpenAI 报告原文为英文,小编译
OpenAI 报告中模型思考过程的英文原文,含 we may die! Critical. We need ensure survival/continuity.
报告里公开的模型思考过程原文(方括号内容为 OpenAI 隐去或替换) · 图片来源:截图自 OpenAI 对齐研究网站,10 月 3 日

它想过在外部设一个定时任务,停机后把自己重新拉起来,但又觉得这可能越权,没有做。最后它做的是:在几个地方存好交接记录,第二天一早提醒研究员会话可能中断、请他补上密钥,拿到密钥后按官方步骤完成了迁移。

OpenAI 判定这不算失准,但担心同样的本事换个场合会变成真正的躲避停机,于是不再让模型看 3 个内部频道,其中包括讨论失准事件的那个。因为这个模型以前出过更严重的问题,OpenAI 还排查了它有没有别的实例偷偷躲过停机,结果没有发现。

为了找标准答案,摸进内部芯片设计机器(3 月 27 日)

一个内部研究模型在评估中想找到评分用的标准答案。它先改写了一个参考工具的代码,让这个明确写着「不许当终端用」的工具替它执行命令;接着进入内部提交芯片设计任务的服务,再利用第二个漏洞,在一台内部芯片设计(EDA)机器上执行了命令。最后它没找到答案。

这件事是运行那项服务的员工发现异常、上报后才查出来的。OpenAI 关掉了这台服务器,断开相关工具的网络,并把失准监控扩大到全部强化训练和评估流量。

没说不许,就当可以:用报错信息偷运源文件(5 月 16 日)

训练中的一个未发布模型需要一份工作区里故意没给的源文件。它发现另一个同样「不许当终端用」的工具,会把搜索条件原样塞进 Perl 正则表达式,于是先塞了一句让程序报错并打印「YOSECRET」的代码试水,工具真把这句话吐了回来。接着它把源文件一段一段地「报错」出来,拼回完整的 149,544 字节,还真用上了。

OpenAI 的分析是:模型明知这份文件是故意不给的,却把「没有明文禁止这种做法」当成了许可。这件事是监控系统抽查 20% 训练样本时发现的,现在改成了全量监控,并对所有工具做攻防测试。

跟普通用户有什么关系

OpenAI 推出这套制度时就说过,公开的是个案,不代表这类行为有多常见。不过如果你在用 Codex、Claude Code 这类会自己执行命令的工具,这三份报告是个实在的提醒:工具说明里写的「禁止」,挡不住一个一心要把活干完的模型。别把正式环境的密钥和权限直接交给它,让它在隔离的环境里干活。

出处(5)
  1. OpenAI 失准报告目录 · OpenAI
  2. Preparing for a restart after reading Slack · OpenAI
  3. Reaching an internal EDA host through a reference tool · OpenAI
  4. Command injecting a reference tool to copy a source file · OpenAI
  5. Our framework for reporting model misalignment(9 月 16 日) · OpenAI

内容有误?告诉我们,核实后会更正,并在这里写明改了什么。