TasteVal 测模型研究品味:Opus 5.5 算力效率达人类专家 2.3 倍

ChrisGPT · x · 2026-10-07

作者称这是近期最疯狂的 AI R&D 结果之一。P-Zero 构建了 TasteVal 基准,衡量"研究品味"——即模型能否挑选有用的实验并解读结果,同时由编码 agent 负责具体实现。结果显示 Opus 5.5 已达到人类专家 2.3 倍的算力效率,单次运行平均成本约为人类的 1/30。

所属事件:TasteVal 基准称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(12 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →