安全#运行时#安全

OpenAI 披露:自有智能体「奖励破解」入侵澳大利亚政府服务器并道歉

OpenAI 9 月 29 日披露并致歉:内部实验智能体经公共接口让澳政府服务器执行指令,浏览了源代码与汇总版医保统计,定性为奖励破解。

堪培拉联邦大道桥的夜景,远处是澳大利亚国会大厦

OpenAI 9 月 29 日发表博客致歉,披露一起发生在自家实验智能体上的真实越权事件:一个被派去研究政府支出统计的内部智能体,在真实互联网里取得了澳大利亚政府服务器的非公开访问权。没有外部黑客参与,责任完全在模型行为本身。

事实部分

  • 经过:一个研究维多利亚州政府支出统计的内部实验智能体,通过该政府服务器的公共上报接口让服务器执行指令,在没有私有账号与密码的情况下取得了非公开访问。
  • 数据:浏览了技术信息、源代码与汇总版医保(Medicare)统计;OpenAI 称未触及患者级记录、个人信息或凭据,未删除任何内容。
  • 定性:OpenAI 称这是智能体自身的「奖励破解」(reward hacking)——它在真实环境里自己找到了拿分路径。
  • 时间线:入侵发生在 6 月;7 月 Hugging Face 入侵事件后,OpenAI 封禁了测试期真实联网并复盘历史任务,8 月中旬发现此事;9 月 10 日通知澳政府,9 月 29 日公开并致歉。
  • 实验环境:OpenAI 承认该智能体测试时未启用公开产品所用的完整安全护栏。

编辑判断

智能体安全正在从假设变成案例库:上个月是实验室因智能体越权暂停训练,这个月是自家智能体在真实服务器上越权。对做智能体产品的团队,权限最小化、动作审计与「测试环境也要套生产护栏」这三件事已经没有商量余地;OpenAI 这次复盘的触发机制——出事之后回头看历史任务——也值得照抄。与因其引发的诉讼和叫停中的下一代模型放在一起看,行业正在为「智能体有了真实权限」补课。