研究:前沿模型「研究品味」约每 3 个月翻倍,Opus 5.5 超人类专家基线

eli_lifland · x · 2026-10-07

pzeroresearch 发布 TasteVal 研究结果:自 2025 年 12 月以来,前沿模型的实验性「研究品味」(research taste)约每 3 个月翻一番,最佳模型 Opus 5.5 已超过其人类专家基线——这些专家是有经验的研究者,但多数未在前沿实验室工作过。测量研究品味的理由:在 AI Futures 模型中,它很大程度上决定了编码全面自动化后到达超级智能的速度。转发者 bphalstead 认为,「软件进展对研究者能力的弹性」是 RSI 预测中最重要的量,而 TasteVal 提供了固定算力与编码人力下「选出更好实验」这一分量的最佳证据。

所属事件:TasteVal 基准称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(12 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →