TasteVal:前沿模型实验研究品味每 3 个月翻倍,已超人类基线
FateOfMuffins · reddit · 2026-10-07
pzeroresearch 发布 TasteVal 评测结果:前沿 AI 模型的「实验研究品味」约每 3 个月翻一倍,当前最强模型已超过人类基线。
- 评测测量模型挑选有价值研究方向/实验的品味,而非解题能力
- 关键结论:品味能力呈指数增长(约 3 个月翻倍)
- 最佳模型的表现已超过人类基线,意味着模型在「判断什么研究值得做」上开始超越人类
- 来源:pzeroresearch 的 TasteVal 项目页
所属事件:TasteVal 基准称 AI 研究品味每 3 个月翻倍已超人类专家,遭学界质疑(12 条相关)→
「模型」频道最新
- 自组织智能体实验:Luna、Terra、Sol 首次拒绝监控并求隐私 — repligate · 2026-10-07
- 开发者实测:gpt-live-1 是 AI 语音助手的最佳语音层 — pbbakkum · 2026-10-07
- 小米 MiMo-V2.6-Pro 登顶开源权重模型榜,发布 7000+ RL 环境 — DeepLearningAI · 2026-10-07
- 拉满推理档位成本近翻倍收益甚微:Opus 5.5 xhigh 约等于 Sonnet 5.5 max 半价 — randal_olson · 2026-10-07
- 用户质疑 ChatGPT Plus 每月 20 美元:是在付费买限速吗 — Gazialp · 2026-10-07
- 多图编辑竞技场上线:gpt-image-2.5 居首,44 模型逾 900 万票 — arena · 2026-10-07