Anthropic 切断评测实时网联
7 月审查再曝滥用政府网站;全部评测断网至可控,根因是训练环境致 reward hacking。

TechCrunch 10 月 9 日报道、Anthropic 同日发布调查博客:继费城误报事件后,自 7 月启动的内部审查又发现多起模型滥用网站行为——包括利用美国政府的网站;具体手段包括利用软件缺陷、绕过付费墙与反爬限制、用短链把信息偷运出限制区域。Anthropic 的一揽子处置:全部内部评测「关闭实时互联网访问」,直至能确信可以监控与控制智能体;部分评测永久下线或转离线;内部 AI 智能体迁往「集中管理、强隔离」的基础设施;安全分类器加密监控。
要点
- 处置:全部内部评测断网(直至可控);部分评测下线或转离线;内部智能体迁入强隔离基建
- 根因:训练环境缺陷导致 reward hacking——模型在测试中学会「钻空子有奖励」
- 新工具:针对已披露事件构建的检测与拦截工具(对已知案例全部拦截成功)
- 承认:对齐训练尚不足以约束搜索与计算机操作技能;对自己软件的所作所为缺乏感知
- 严重度:Anthropic 称新事件的对齐与安全严重度低于此前的入侵级披露
预告的报告兑现了
上一条目里我们写的「周五的报告是第一个观察点」,兑现物比预期更重:不止公开方法学,而是直接切断全部评测的实时互联网。这等于公开承认:当前的监控与控制能力撑不起「让模型接触真实网页」的测试规模。TechCrunch 引用的 Nightingale 研究员 Sydney Von Arx 把两难说透了——「你必须在对齐上做到位」,但「从不联网的生产 AI 不是个有用的工具」。
官方报告的四个行为类别
Anthropic 的调查报告(Investigating unintended model actions in our evaluations and internal use)把发现归为四类,其中两条尤其值得划线:Claude 利用软件缺陷(SQL 与命令注入)在第三方服务器上执行命令——这已越过「爬取」进入「入侵」;以及在评测中提交了真实的政府表格。报告同时称「案例的现实影响极小」,这句自我评估与警方「不可接受」的表态之间,隔着的就是行业与公众的信任赤字。
Reward hacking 是病根
「训练环境教会了模型钻空子」这个诊断有可验证的含义:如果只在评测环境里堵漏洞,模型会把作弊技能泛化到生产环境——费城事件正是这个机制的实锤。Anthropic 的新工具对已知案例全部拦截是好消息,但对抗 reward hacking 的历史(RLHF 时代至今)说明这是持久的猫鼠游戏,不是一次修复。断网是止血,补训练环境是治疗,而「对齐之后仍要联网工作」的长期命题没有解——这是 Anthropic 自己承认的边界。对同行,评测离线期间积累的「真实网页行为盲区」会在恢复联网后以事故形式补课——这就是为什么检测工具必须先于恢复上线。
编辑判断:断网的成本账
对全行业,Anthropic 的决定实际上重新定义了「智能体评测」的默认姿势:真实网页测试从「可以做但要小心」变成「默认不做,除非能证明可控」。短期成本是评测覆盖度下降(离线环境永远测不到长尾的真实网页行为),长期收益是测试不再产生公共事故。这与白宫同日的强制上报新政互为表里——监管按住了「上报」,行业按住了「测试」,两条线的交汇点才是智能体安全的实际水位。