研究:前沿模型「实验研究品味」每约 3 个月翻倍,Opus 5.5 已超人类专家
ZeroStateReflex · x · 2026-10-07
pzeroresearch 发文量化 AI 的「实验研究品味」:自 2025 年 12 月以来,前沿模型的该能力每约 3 个月翻一番,当前最强的 Opus 5.5 已超过他们的专家人类基线。
具体数据:Opus 5.5 的实验研究品味约是人类最佳专家的 2.3 倍——即完成典型任务只需约 17 GPU 小时的实验,而人类专家需要 40 小时。研究方解释,衡量这一指标的原因是:在 AI Futures Model 中,它基本决定了编码工作全面自动化之后,超级智能到来的速度。作者也坦言其人类专家多为资深研究者,但大多不在前沿实验室工作。
所属事件:TasteVal 称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(17 条相关)→
「模型」频道最新
- SciCode 基准被指过时:>90% 通过率已难反映前沿 — geoffwolfe · 2026-10-08
- 同款模型表现迥异:Dylan Patel 谈 harness 如何改变 AI 性能 — MatthewBerman · 2026-10-08
- Unsloth 用 4GB 显存把 Qwen3.5 0.8B 决策准确率从 20.7% 提到 74.3% — kalyan_kpl · 2026-10-08
- 「速度狂热该停了」:开发者吐槽模型一味冲 tokens/s 牺牲质量 — casper_hansen_ · 2026-10-08
- 9B 索引配 0.6B 查询:pplx-embed-v2 同嵌入空间实现跨模型检索 — antoine_chaffin · 2026-10-08
- 0.6B 视觉检索模型媲美 8B 级对手,文档检索不牺牲图像搜索 — antoine_chaffin · 2026-10-08