前沿模型「研究品味」每约 3 个月翻倍,Opus 5.5 已超人类专家基线

s_tworkowski · x · 2026-10-07

pzeroresearch 发布新测量结果:自 2025 年 12 月以来,前沿模型的「实验研究品味」(experimental research taste)大约每 3 个月翻一倍。表现最好的模型 Opus 5.5 已超过其人类专家基线——尽管这些专家多为有经验的研究者,但大多未在前沿实验室工作过。

作者认为这一指标至关重要:在 AI Futures 模型中,研究品味很大程度上决定了当编码工作被完全自动化后,通往人工超级智能(ASI)的速度。有人将其称为「自 METR 时间线图以来最重要的图」。

所属事件:TasteVal 基准称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(12 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →