Terminal-Bench Science 数月内近饱和,科学评测亟需动态环境
shyamalanadkat · x · 2026-09-04
引用帖指出,Terminal-Bench Science 发布仅数月已接近 70% 饱和度,而其原始设计基线只有 10-20%,静态、容器化的计算流程 benchmark 正撞上天花板,科学类评测的构建方法论需要重新定义。作者认为新模型(Astra)能力强劲,但只要模型还无法解决或提出千禧年级别难题,评测就该转向动态环境——像造一个每步改变胜负规则的新围棋,而非反复刷固定关卡。发帖人以「feeling the agi?」回应,感叹模型进展之快。
「漫话AGI」频道最新
- 博主对比两组数据:读者点击与 Google AI Overview 引用几乎不重叠 — shashib · 2026-09-04
- AI 从业者:训练数据的构建才是最有创造力的一环,数据集只是冰山一角 — joecole · 2026-09-04
- 博主预言:2027 年初 AI 游戏开发将成大厂股东会争论焦点 — ChrisGPT · 2026-09-04
- Gary Marcus 称读到史上最吓人文字,Jachimowicz 回应:我在为对 AI 竞争做准备 — jachiam0 · 2026-09-04
- Scoble 回应自动化质疑:没人该被留在流水线摘草莓 — Scobleizer · 2026-09-04
- 机器必有情绪?Sloman 1981 年论文早已给出计算分析 — yeastsplainer · 2026-09-04