任务描述越模糊,不同模型家族越容易犯同样的错?

breadstickdingdong · reddit · 2026-09-17

Reddit 用户提出一个研究性问题:不同模型家族在面对同一个欠规范(underspecified)任务时,往往以相同方式失败,而非独立失败。作者想找的是测量层面的工作——是否有人量化过任务规范的歧义程度,并验证其能否预测独立求解器的「巧合失败率」。

核心问题:这种关系是平滑单调上升,还是存在某个歧义阈值,超过后巧合失败率会陡增?作者征求直接测量过这一关系的论文、指标或 benchmark,相邻工作也可推荐。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →