TRACES 榜单:GPT-6-astra 登顶但自修复能力落后 Opus-5
thisdudelikesAI · x · 2026-09-12
新兴评测机构 TRACES 上线了面向智能体能力的六维排行榜(0-4 分制,涵盖工具调用、自修复、假设管理、长程一致性、证据 grounding、范围限定),并用同一 harness 对多款前沿模型跑了 140 个 agent 回合对比。
要点:
- GPT-6-astra 总分登顶,对 GPT-5.6-sol 六项全面领先,但提升不均匀:工具调用 2.34→2.80、假设管理 2.10→2.80、一致性 2.63→3.15、证据 2.26→2.76,自修复仅 1.81→2.01。
- 分项冠军各不相同:工具调用 GPT-6-astra 最高(2.80);自修复 Opus-5 居首(2.59);假设管理 Opus-5(2.85)、GLM-5.2(2.82)领先;GPT-6-astra 的自修复在对比中排到中游。
- Kimi-k3、GLM-5.2、DeepSeek-v4-flash 等模型均在榜单各维度中占据靠前位置,显示顶级模型间能力结构差异明显。
「编程与Agent」频道最新
- 开发者喂 GPT-6《GT 赛车》与 F1 电影,生成可交互 3D 赛车场景 — cedric_chee · 2026-09-13
- 编码 Agent 会自创形式语言,自然语言或成其元语言 — jmugan · 2026-09-13
- Uncle Bob 发文质疑 Agent Harness 设计,呼吁重新思考 — blaizedsouza · 2026-09-13
- 毒事件隔离清单:坏消息不再阻塞整条队列的 6 步实践 — blaizedsouza · 2026-09-12
- Agent 别自己调所有下游系统:一条事件、多个消费者的扇出模式 — blaizedsouza · 2026-09-12
- 独立开发者用 Claude 打造 D&D 世界模拟,NPC 会记住并回应你的行为 — tschilpi · 2026-09-12