Box^2-Bench:前沿模型难以及时无视不可靠的工作流指导

Minghan Wang · hf · 2026-10-01

提出'跳出框架思考'概念:模型既要善用可靠指导,也要能推翻误导性指导。Box^2-Bench 固定模型与任务、只变化工作流可靠性,隔离测量模型对指导的依赖调节能力。

发现:前沿模型能从可靠工作流获益,但面对误导性或中途变糟的工作流依然脆弱。训练实验:用坏工作流训练、好工作流评测,反事实 SFT 提升鲁棒性,基于结果的 RL 则更倾向使用有帮助的工作流。该行为可泛化到同行纠错与损坏记忆等外部信息场景,揭示任务成绩之外被忽视的智能体可靠性维度。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →