ValsAI 称 GPT 6 Astra 已基本打满 SRE-Bench 网络安全基准

sandersted · x · 2026-09-04

评测机构 ValsAI 发帖称,OpenAI 的 GPT 6 Astra(该名称未获官方确认)在 SRE-Bench 上已"有效饱和"——这是一个测试模型能否逆向工程二进制文件的网络安全基准。团队同时发布了更多信息,并公开征集贡献以扩展该基准,暗示现有题目已不足以区分顶级模型的能力上限。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →