TerminalBench-Science 难度极高:模型分数大幅下降
BenBlaiszik · x · 2026-08-28
对比显示,相同模型在 Terminal-Bench 3.0 上得分显著更高(Fable 5: 83.8%),而 TerminalBench-Science (TBS) 将所有模型分数压低了 10 分以上。这种难度是针对最新前沿模型专门校准的。项目筛选门槛极高,从 920 个提案中仅选出 70 个任务,每个任务耗时不菲。
所属事件:斯坦福发布科研基准 TBS,Opus 5 通过率仅30%(14 条相关)→
「研究」频道最新
- 小规模复现大模型训练不稳定:学习率敏感度研究 — stochasticchasm · 2026-08-28
- MLC 模型评估是否算双盲实验?业界存疑 — BlancheMinerva · 2026-08-28
- 探讨 Claude 意识、思维链与对齐机制的可解释性 — ChengleiSi · 2026-08-28
- 开发者分享各自的 NS 迭代训练配置 — stochasticchasm · 2026-08-28
- Rei Labs 发布 Discovery:移除人工预设,实现自主结构发现 — EnigmaFund · 2026-08-28
- 发布《百页语言模型》PyTorch 实战书 — burkov · 2026-08-28