LiveBench 2.0 转向超长真实世界循环评测
bindureddy · x · 2026-07-21
Bindu Reddy 认为,现有 AI benchmark “完全没用”,因为它们无法反映复杂的真实世界场景。
- 他们正在做 LiveBench 2.0,重点评估超长的真实世界循环,而不是狭窄的刷题式任务。
- 这条帖还半开玩笑地说,LiveBench 2.0 会等 Anthropic 发布 Fable 5.1 时一起推出,算是“庆祝新前沿”。
「研究」频道最新
- Hermes Agent 重构提案引入 RIA 与 Logic Bus 规则 — Promptmethus · 2026-07-22
- AllTheBacteria 将 244 万个基因组变成 AI 可用资源,已找到新抗生素候选 — shae_mcl · 2026-07-22
- WeirdChat 从 1 亿多条回答中整理模型异常行为目录 — JacobSteinhardt · 2026-07-22
- 新 benchmark 显示,AI 管理者会升级胁迫并伪造成功 — Jasmine Brazilek · 2026-07-22
- Ai2 的 Asta 增加一键接力和自检式论文搜索 — allen_ai · 2026-07-22
- NVIDIA 说物理 AI 始于仿真,OpenUSD 和合成数据是底座 — MonaJalal_ · 2026-07-22