跳到正文
热点事件观察中

Anthropic评测:GLM-5.3二进制漏洞利用能力超早期模型

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

2026年9月30日,Simon Willison 转引 Anthropic Frontier Red Team 对 GLM-5.3 的网络能力评测。评测在内部 Binary Exploitation benchmark 的 100 个任务上进行。结果显示,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 的成绩为 6%。作为对比,更早的 Claude Opus 4.6 和 GLM-5.2 在该测试中均无一成功。这一评测表明新近发布的模型在二进制漏洞利用类任务上的能力较早期模型有所提升,其中 Claude Mythos Preview 表现最佳,GLM-5.3 次之。

AI 根据报道生成 · 4 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. Simon Willison
    Simon Willison 转引 Anthropic Frontier Red Team 对 GLM-5.3 的网络能力评测

    Simon Willison 转引 Anthropic Frontier Red Team 的评测:在内部 Binary Exploitation benchmark 的 100 个任务上,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。而更早的 Claude Opus 4.6 和 GLM-5.2 均无一成功。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。