前沿模型「研究品味」每3个月翻倍,已超人类专家基线
coherence · x · 2026-10-07
- pzeroresearch 测量前沿模型挑选有价值实验的「实验研究品味」,发现自 2025 年 12 月以来每约 3 个月翻倍。
- 最佳模型 Opus 5.5 的研究品味已超过其人类专家基线;人类专家多为经验丰富的研究者,但多数未在前沿实验室工作过。
- 测量动机:在 AI Futures 模型中,研究品味大体决定了编码全面自动化之后,通向超智能的速度。
- 结论:AI 将很快在「构建自己的后继者」上全面掌控实验选择环节。
所属事件:TasteVal 称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(17 条相关)→
「漫话AGI」频道最新
- 「这是做研究的最好时代」:AI 正在摧毁旧的科研游戏规则 — aran_nayebi · 2026-10-08
- 数学家撰文:为何对 AI 数学革命感到兴奋而非恐惧 — StefanoGogioso · 2026-10-08
- 借《三体》谈 AGI 时代:文明级威胁需要世纪尺度的长期主义 — JacquesThibs · 2026-10-08
- COLM'26 三篇论文:自对弈基准 MathDuels 让评测难度随模型共进化 — AI4Code · 2026-10-08
- eigenrobot 争 AI 安全圈预测文化:量化概率比含糊说"不确定"更有价值 — eigenrobot · 2026-10-08
- OpenAI 数学成果剑指四大千禧难题,deedydas 断言 AGI 已至 — deedydas · 2026-10-08