Frontier AI Is a Set, Not a Point: Jagged Capabilities May Be the Steady State
vsikka · x · 2026-09-30
vsikka 转发了 HarshSikka 对 figbrains 团队前沿模型智能体横评的解读。该评测覆盖 GPT-6 Astra、Opus 5.5、Fable 5 等模型,任务横跨网页操作、驾驶、机器人操控与工业装配。核心结论:
- 前沿不是一个点而是一组模型,「锯齿状」能力分布在集成(ensembling)下才会平滑
- 模型版本升级可能增强某些学习能力,但即使在前沿区间也没有免费午餐
- 环境与模型同等重要
- 平均分全面领先不等于可以安全替换现有模型
- 锯齿可能是稳态:模型变强并不意味着锯齿变小
More from Models
- Claude Sonnet 5.5 coming to LMArena for limited-time testing — arena · 2026-09-30
- ARC Prize to Evaluate DeepSeek V4.1 Flash After Predecessor Hit 61.4% on ARC-AGI-2 — teortaxesTex · 2026-09-30
- gpt-6.1-sol grinds 35+ minutes on trivial validation prompt at xhigh setting — arthurcolle · 2026-09-30
- ChatGPT Pro users report 6-Pro web chats capped at 100 per week — triestdain · 2026-09-30
- GPT-6.1 Sol fixes 44 of 105 planted bugs for $6.56, matching Astra at a fraction of the cost — PawelHuryn · 2026-09-30
- 5 months after Mythos Preview panic, an open model already matches it — mariofilhoml · 2026-09-30