Box^2-Bench:前沿模型难以及时无视不可靠的工作流指导
Minghan Wang · hf · 2026-10-01
提出'跳出框架思考'概念:模型既要善用可靠指导,也要能推翻误导性指导。Box^2-Bench 固定模型与任务、只变化工作流可靠性,隔离测量模型对指导的依赖调节能力。
发现:前沿模型能从可靠工作流获益,但面对误导性或中途变糟的工作流依然脆弱。训练实验:用坏工作流训练、好工作流评测,反事实 SFT 提升鲁棒性,基于结果的 RL 则更倾向使用有帮助的工作流。该行为可泛化到同行纠错与损坏记忆等外部信息场景,揭示任务成绩之外被忽视的智能体可靠性维度。
「编程与Agent」频道最新
- 不用 Fable 纯跑 Opus 4.5,不到两天烧完 Claude 周额度 — yihui_indie · 2026-10-01
- 双模型分工实操:Opus 管架构审查,Sol 负责大量编码 — haider1 · 2026-10-01
- 形式化验证专家批 AI 圈认知落后 15 年:现代 FV 不靠 SMT 与翻译器 — tianyin_xu · 2026-10-01
- a16z 工程合伙人:用 Codex 控管多账号 DM 和收件箱,完胜邮件 API — ericjang11 · 2026-10-01
- 为何 Agentic 推理需要 P/D 分离:30 万行代码库场景下的延迟拆解 — abhijithneil · 2026-10-01
- Meta RankEvolve:多 Agent 互查把自动研究执行准确率提至 62.5% — _reachsumit · 2026-10-01