AI 研究新范式:用测试算力决定跑哪个实验
anirudhg9119 · x · 2026-09-01
介绍论文《AI Research Preference Models》,解决 AI 研究代理在计算预算受限时的候选方案选择问题。
核心内容:
- 问题:AI 研究代理 (AIRA) 可以提出大量候选实验,但 GPU 评估成本高昂,无法全部运行。进度取决于其“研究偏好”,即如何分配固定预算。
- 方法:提出 AI 研究偏好模型 (RPM),利用预训练语言模型预测最有希望的候选方案,无需全部运行。
- Inference-only 模型:推理候选计划、代码和历史执行结果。
- Agentic 模型:额外运行小规模试点实验。
- 结果:集成到 AIRA-dojo 并在 AIRS-Bench 上评估,两种变体分别将平均归一化分数从 0.684 提升至 0.711 和 0.729。
- 结论:智能体知道“不运行什么”同样重要;选择质量本身随算力扩展。
所属事件:新论文提出AI研究偏好模型 在算力受限时筛选最优想法(6 条相关)→
「编程与Agent」频道最新
- Blume:让不同编程 Agent 共享规则记忆的本地工具 — thisiskp_ · 2026-09-01
- 批评 Anthropic 将用户命令与 Agent 技能混用 — johnlindquist · 2026-09-01
- 用 Git Worktree 让多 Agent 并行开发互不干扰 — EXM7777 · 2026-09-01
- 用LLM Wiki给Agent做长期记忆的工作坊:散乱资料变知识库 — Al_Grigor · 2026-09-01
- 烧掉10亿tokens造Agent客户端,GPT交付的是管理后台 — sujingshen · 2026-09-01
- 用户直言 Codex 远超对手,当前热门 agent 被高估 — demian_ai · 2026-09-01