安全#安全

Anthropic 威胁报告点名 GLM-5.3:最强开放权重攻击模型,护栏可绕过

Anthropic 威胁报告称智谱开源的 GLM-5.3 是迄今攻击能力最强的开放权重模型,ExploitBench 得 50 分,护栏易被绕过。

铁链与挂锁锁住的金属门

Anthropic 9 月 30 日发布威胁报告,点名智谱 8 月开源的 GLM-5.3:迄今攻击能力最强的开放权重模型,且安全护栏易被绕过。量子位的报道角度是「这算不算给 GLM 打广告」——报告把攻防两面的数字都摆了出来。

事实部分

  • ExploitBench:GLM-5.3 得 50 分(410 次尝试),Anthropic 自家 Claude Mythos Preview 为 56 分。
  • 第三方口径:NIST/CAISI 9 月 17 日已称 GLM-5.3 是最强开放权重模型,攻击能力约落后美国前沿 4 个月。
  • 护栏绕过:消融(abliteration)处理后的权重约 4,400 美元即可把拒答率从 90% 以上压到个位数。
  • 复现案例:研究员用 GLM-5.3 约 8 小时、20.40 美元 API 成本搭出 ARM64 攻击链(利用 Chrome CVE-2026-11645)。
  • 背景:这是 Anthropic 9 月 10 日指控七家中国实验室(含智谱)蒸馏其模型之后又一次点名;报告未否认 GLM-5.3 开源发布本身合法。

编辑判断

开放权重的攻防两面被放进同一份报告:模型强是真的,护栏脆也是真的——这正是开放权重模型的常态,而不是智谱独有的问题。对做模型安全准入的团队,报告里可直接复用的是两个数字:ExploitBench 分数线与 4,400 美元的消融成本。注意信源是竞对实验室的威胁报告,Nex-N2.5 等开放权重模型在智能体跑分上的表现可作交叉参照;把「威胁报告」当营销读、也当技术数据读,两个都做。