前沿模型「研究品味」每约 3 个月翻倍,Opus 5.5 已超人类专家基线
s_tworkowski · x · 2026-10-07
pzeroresearch 发布新测量结果:自 2025 年 12 月以来,前沿模型的「实验研究品味」(experimental research taste)大约每 3 个月翻一倍。表现最好的模型 Opus 5.5 已超过其人类专家基线——尽管这些专家多为有经验的研究者,但大多未在前沿实验室工作过。
作者认为这一指标至关重要:在 AI Futures 模型中,研究品味很大程度上决定了当编码工作被完全自动化后,通往人工超级智能(ASI)的速度。有人将其称为「自 METR 时间线图以来最重要的图」。
所属事件:TasteVal 基准称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(12 条相关)→
「漫话AGI」频道最新
- 数学家人手不足应对 AI 证明浪潮,人机半人马协作或成解法 — bradneuberg · 2026-10-07
- 「预训练只是热身」:业内共识转向后训练 RL 与推理吃掉大部分算力 — joeddav · 2026-10-07
- AI 改造失败流程只是「自动化复杂性」:先重构流程再上 Agent — kashifmanzoor · 2026-10-07
- 补充澄清:质疑的是 overclaim,不是工作本身 — anpaure · 2026-10-07
- Domingos:AI 进展就算立刻停滞,OpenAI 与 Anthropic 仍会坚信奇点已至 — pmddomingos · 2026-10-07
- 前 Anthropic 研究员上 Jon Stewart 节目:未来没有岗位,只有普遍高收入 — Neurogence · 2026-10-07