Terminal-Bench Science 数月内近饱和,科学评测亟需动态环境

shyamalanadkat · x · 2026-09-04

引用帖指出,Terminal-Bench Science 发布仅数月已接近 70% 饱和度,而其原始设计基线只有 10-20%,静态、容器化的计算流程 benchmark 正撞上天花板,科学类评测的构建方法论需要重新定义。作者认为新模型(Astra)能力强劲,但只要模型还无法解决或提出千禧年级别难题,评测就该转向动态环境——像造一个每步改变胜负规则的新围棋,而非反复刷固定关卡。发帖人以「feeling the agi?」回应,感叹模型进展之快。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →