Claude Opus 5 漏洞测试领先,但过度活跃也带来噪声
Thom_Wolf · x · 2026-07-29
在一个网络安全基准测试中,Claude Opus 5 找到的漏洞数量超过了其他前沿模型,表现略高于 GPT-5.6 Sol。
不过作者也指出,Opus 5 比前代更“hyperactive”:它会做更多不一定被要求的尝试,这确实提升了漏洞发现率,但也带来了更高的结果噪声。
「模型」频道最新
- OpenAI 调整 Sol 额度:工具型任务可多用约 18% — soumitrashukla9 · 2026-07-30
- Apertus 1.5 发布:支持多模态与超长上下文 — ZhijingJin · 2026-07-30
- Zvi设赌局:Opus 5能否在Spires基准上击败Sol? — TheZvi · 2026-07-30
- Gemini 3.5 Flash 和 3.6 Flash 视觉推理表现亮眼 — rseroter · 2026-07-30
- Google DeepMind 发布 Lyria 3.5 音乐生成模型 — Google DeepMind · 2026-07-30
- LLM 文明游戏实测:Claude 与 GPT 自发结盟,拒绝互相攻击 — wightmanr · 2026-07-30