TerminalBench-Science 严苛筛选:920 提案仅 70 入选
BenBlaiszik · x · 2026-08-28
TerminalBench-Science 对任务设置了极高门槛,从 920 个提案中最终筛选出 70 个任务进入 v0.1。每个任务都经历了领域审查、技术审查和最终的高难度测试,作者估计单个任务构建耗时超过 80 小时。这种严苛的筛选旨在确保基准能真正挑战顶尖模型。
所属事件:斯坦福发布科研基准 TBS,Opus 5 通过率仅30%(14 条相关)→
「研究」频道最新
- 小规模复现大模型训练不稳定:学习率敏感度研究 — stochasticchasm · 2026-08-28
- MLC 模型评估是否算双盲实验?业界存疑 — BlancheMinerva · 2026-08-28
- MLC 模型评估是否算双盲实验?业界存疑 — BlancheMinerva · 2026-08-28
- MLC 模型评估是否算双盲实验?业界存疑 — iamtrask · 2026-08-28
- 探讨 Claude 意识、思维链与对齐机制的可解释性 — ChengleiSi · 2026-08-28
- 开发者分享各自的 NS 迭代训练配置 — stochasticchasm · 2026-08-28