前沿模型能力全是锯齿:平均分第一也不代表能随便换用
vsikka · x · 2026-09-30
vsikka 转发了 HarshSikka 对 figbrains 团队前沿模型智能体横评的解读。该评测覆盖 GPT-6 Astra、Opus 5.5、Fable 5 等模型,任务横跨网页操作、驾驶、机器人操控与工业装配。核心结论:
- 前沿不是一个点而是一组模型,「锯齿状」能力分布在集成(ensembling)下才会平滑
- 模型版本升级可能增强某些学习能力,但即使在前沿区间也没有免费午餐
- 环境与模型同等重要
- 平均分全面领先不等于可以安全替换现有模型
- 锯齿可能是稳态:模型变强并不意味着锯齿变小
「模型」频道最新
- ARC Prize 将评测 DS V4.1 Flash:前代曾达 61.4%,80% 以下算失望 — teortaxesTex · 2026-09-30
- GPT-6.1 Sol 生成 3D 键盘装配动画,价格仅为 Sonnet 5.5 三十分之一 — BorisMPower · 2026-09-30
- Claude Sonnet 5.5 即将上线 LMArena,可直接实测 — arena · 2026-09-30
- ARC Prize 将评测 DeepSeek V4.1 Flash,前作曾得 ARC-AGI-2 61.4% — teortaxesTex · 2026-09-30
- gpt-6.1-sol 跑简单校验任务 35 分钟未停,用户担忧额度耗尽 — arthurcolle · 2026-09-30
- ChatGPT Pro $200 档 6-Pro 网页聊天砍到每周 100 次 — triestdain · 2026-09-30