评测盲区:不同 AI 科研 agent 做事风格迥异,榜单却只看一个分数

ChengleiSi · x · 2026-10-07

作者观察到两个 AI 科研 agent 面对同一任务展现完全不同的「性格」:Fable 鼓励你尝试更大的目标,Astra 则建议先跑试点、逐项验证证据。现实中这种过程差异至关重要——决定了你合作的是严谨的科学家还是鲁莽的赌徒,但当前基准榜单把科学探索压缩成一个盲目的数字。

作者提出:AI 科研的完整过程如今首次被完整记录在日志里,人类终于有机会打开黑箱,直接对「研究过程本身」做基准评测。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →