跳到正文
原文
Simon Willison·· 8 天前AI 评分70

Anthropic 前沿红队:GLM-5.3 与 Claude Mythos Preview 在二进制漏洞利用任务上的表现

Quoting Anthropic Frontier Red Team

AI 导读

Anthropic 前沿红队在内部 Binary Exploitation benchmark 中随机抽取 100 个任务评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中无一成功,说明一个有意义的能力门槛已被跨过。

来源:Simon Willison · simonwillison.net