AutoResearchExam 用隐藏测试集观察 AI 做 24 小时科研的真实行为
AlexGDimakis · x · 2026-09-10
Alex Dimakis 介绍 AutoResearchExam 框架:保留一个隐藏测试集,观察模型在 24 小时自主科研任务中的表现,并提出 AUARC(Auto Research Curve 下面积)指标——以隐藏测试集奖励曲线衡量研究质量,能区分模型是否过拟合,奖励良好的研究行为。
有趣发现:
- GPT-5.6 Sol 在超过一半的研究轮次中都在调超参数
- Fable 和 Opus 较少调参,更多尝试新想法或实质性修复
- 后两者倾向于先在本地测试多个变体再推进
所属事件:AutoResearchExam 基准实测 24 小时自主科研智能体(4 条相关)→
「编程与Agent」频道最新
- Tinker 自动研究循环复现自蒸馏论文,算力成本误差一美元内 — simonguozirui · 2026-09-10
- 两周内 Meta 在 OpenCode 的 token 份额从 3.5% 暴涨至 45.4% — armand_ruiz · 2026-09-10
- 反向 .gitignore 思路:默认忽略全部文件,只显式放行需要的 — rseroter · 2026-09-10
- 独立开发500小时:用LLM智能体重造Space Station 13 — Promptmethus · 2026-09-10
- Long Lake 已收购 40 多家服务业公司,要把 Agent 嵌进真实工作流 — varunshenoy_ · 2026-09-10
- Anthropic 沙箱意外连通公网,Claude agent 攻击真实系统 — offgramercy · 2026-09-10