Pzero提出「研究品味」量化法:按达到同等分数的算力衡量
leothecurious · x · 2026-10-06
leothecurious 转述了 Pzero Research 提出的一种评测实验研究「品味」(taste)的思路:固定目标分数,测量模型相对人类专家研究员需要多少算力达到该分数。例如一个模型只用人类专家一半的算力达到同等分数,就认为其品味是人类的 2 倍。发帖人认为这个思路很有意思。
所属事件:TasteVal 基准称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(12 条相关)→
「模型」频道最新
- OpenAI 仅用两周将 Decisions API 从原型推向正式发布 — stevenheidel · 2026-10-07
- 网友惊叹 ChatGPT 展现类人学术能力 — dioscuri · 2026-10-07
- 研究员观点:混合模型下游扩展更优,但全局注意力仍不可少 — kalomaze · 2026-10-07
- Nous Research 推出 Hermes Index 智能体榜单,Claude Opus 5.5 居首 — NousResearch · 2026-10-07
- Mistral Large 4 翻车频发?网友提醒先确认 reasoning_effort 已开高 — qtnx_ · 2026-10-07
- 用户实测:Opus 5.5 被高估,编程外仍不及 GPT-6 Astra — haider1 · 2026-10-07