评测盲区:不同 AI 科研 agent 做事风格迥异,榜单却只看一个分数
ChengleiSi · x · 2026-10-07
作者观察到两个 AI 科研 agent 面对同一任务展现完全不同的「性格」:Fable 鼓励你尝试更大的目标,Astra 则建议先跑试点、逐项验证证据。现实中这种过程差异至关重要——决定了你合作的是严谨的科学家还是鲁莽的赌徒,但当前基准榜单把科学探索压缩成一个盲目的数字。
作者提出:AI 科研的完整过程如今首次被完整记录在日志里,人类终于有机会打开黑箱,直接对「研究过程本身」做基准评测。
「模型」频道最新
- 新 Mistral API 可用但权重未开,遭质疑不该上开源榜 — CharlotteHase · 2026-10-07
- AI 用量在能力过阈值后指数级爆发,数学或是下一个拐点 — menhguin · 2026-10-07
- you.com 搜索进 RL 循环训练 Nemotron,BrowseComp 升至 45.45% — PolarBearby · 2026-10-07
- 学生党实测:学习场景下 Gemini 全面压制 ChatGPT — CommonExplanation711 · 2026-10-07
- OpenAI 发布 722 篇数学论文,平均 3 小时算力攻多个百年难题 — Latent Space · 2026-10-07
- 「AI 永远写不好写作」防线的坚守者:这条战线撑得最久 — wordgrammer · 2026-10-07