研究:前沿模型「实验研究品味」每约 3 个月翻倍,Opus 5.5 已超人类专家

ZeroStateReflex · x · 2026-10-07

pzeroresearch 发文量化 AI 的「实验研究品味」:自 2025 年 12 月以来,前沿模型的该能力每约 3 个月翻一番,当前最强的 Opus 5.5 已超过他们的专家人类基线。

具体数据:Opus 5.5 的实验研究品味约是人类最佳专家的 2.3 倍——即完成典型任务只需约 17 GPU 小时的实验,而人类专家需要 40 小时。研究方解释,衡量这一指标的原因是:在 AI Futures Model 中,它基本决定了编码工作全面自动化之后,超级智能到来的速度。作者也坦言其人类专家多为资深研究者,但大多不在前沿实验室工作。

所属事件:TasteVal 称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(17 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →