研究称 AI 模型实验研究品味已超越人类基线
ResultBackground2450 · reddit · 2026-10-07
Pzero Research 发布 TasteVal 评测,结论是 AI 模型在「实验研究品味」上的表现已超过人类。
- 评测对象是前沿模型挑选有价值研究方向的能力
- 结果显示最佳模型的品味得分超过人类基线,且前沿模型该能力约每 3 个月翻倍
- 项目页:pzeroresearch.com/work/tasteval/
所属事件:TasteVal 称 AI 研究品味每 3 个月翻倍并超人类,遭刷榜质疑(12 条相关)→
「模型」频道最新
- 小米 MiMo-V2.6-Pro 登顶开源权重模型榜,发布 7000+ RL 环境 — DeepLearningAI · 2026-10-07
- 拉满推理档位成本近翻倍收益甚微:Opus 5.5 xhigh 约等于 Sonnet 5.5 max 半价 — randal_olson · 2026-10-07
- 多图编辑竞技场上线:gpt-image-2.5 居首,44 模型逾 900 万票 — arena · 2026-10-07
- BDH-CQ 潜在推理登 ARC-AGI-1:29.5% 成绩,每任务仅 $0.0007 — bendee983 · 2026-10-07
- Mark Tenenholtz:未饱和的旧基准,余量多半来自烂任务和烂评分 — marktenenholtz · 2026-10-07
- Mistral Large 4 预览发布:1T 参数 49B 激活,3,800 块 Grace Blackwell 训成 — Simon Willison · 2026-10-07