研究:前沿模型「研究品味」约每 3 个月翻倍,Opus 5.5 超人类专家基线
eli_lifland · x · 2026-10-07
pzeroresearch 发布 TasteVal 研究结果:自 2025 年 12 月以来,前沿模型的实验性「研究品味」(research taste)约每 3 个月翻一番,最佳模型 Opus 5.5 已超过其人类专家基线——这些专家是有经验的研究者,但多数未在前沿实验室工作过。测量研究品味的理由:在 AI Futures 模型中,它很大程度上决定了编码全面自动化后到达超级智能的速度。转发者 bphalstead 认为,「软件进展对研究者能力的弹性」是 RSI 预测中最重要的量,而 TasteVal 提供了固定算力与编码人力下「选出更好实验」这一分量的最佳证据。
所属事件:TasteVal 基准称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(12 条相关)→
「漫话AGI」频道最新
- 数学家人手不足应对 AI 证明浪潮,人机半人马协作或成解法 — bradneuberg · 2026-10-07
- 「预训练只是热身」:业内共识转向后训练 RL 与推理吃掉大部分算力 — joeddav · 2026-10-07
- AI 改造失败流程只是「自动化复杂性」:先重构流程再上 Agent — kashifmanzoor · 2026-10-07
- 补充澄清:质疑的是 overclaim,不是工作本身 — anpaure · 2026-10-07
- Domingos:AI 进展就算立刻停滞,OpenAI 与 Anthropic 仍会坚信奇点已至 — pmddomingos · 2026-10-07
- 前 Anthropic 研究员上 Jon Stewart 节目:未来没有岗位,只有普遍高收入 — Neurogence · 2026-10-07