TasteVal 测模型研究品味:Opus 5.5 算力效率达人类专家 2.3 倍
ChrisGPT · x · 2026-10-07
作者称这是近期最疯狂的 AI R&D 结果之一。P-Zero 构建了 TasteVal 基准,衡量"研究品味"——即模型能否挑选有用的实验并解读结果,同时由编码 agent 负责具体实现。结果显示 Opus 5.5 已达到人类专家 2.3 倍的算力效率,单次运行平均成本约为人类的 1/30。
所属事件:TasteVal 基准称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(12 条相关)→
「模型」频道最新
- OpenAI 仅用两周将 Decisions API 从原型推向正式发布 — stevenheidel · 2026-10-07
- 网友惊叹 ChatGPT 展现类人学术能力 — dioscuri · 2026-10-07
- 研究员观点:混合模型下游扩展更优,但全局注意力仍不可少 — kalomaze · 2026-10-07
- Nous Research 推出 Hermes Index 智能体榜单,Claude Opus 5.5 居首 — NousResearch · 2026-10-07
- Mistral Large 4 翻车频发?网友提醒先确认 reasoning_effort 已开高 — qtnx_ · 2026-10-07
- 用户实测:Opus 5.5 被高估,编程外仍不及 GPT-6 Astra — haider1 · 2026-10-07