CMU 提出预测信用协议:研究 agent 的科学解释能否带来预测增益?结果未定
CarnegieMellonU · hf · 2026-10-02
CMU 的论文提出「预测信用」(Predictive Credit)度量协议,检验研究 agent 为计划实验提供的解释是否真正带来预测增益。方法上使用配对预测——共享干预、预测者与结果,仅改变描述方式、是否附解释及供体上下文,并用五项检查追踪承诺、兑现、预测增益、对齐与已知信号吸收。
- 在 336 个受控学习前瞻状态、12 个 Tox21 端点与 24 个 OpenML 任务上测试,v5 冻结信用判定不结论;
- Tox21 预注册的 ROC AUC 区间评分伤害检验未达标(D-M=-.0026),OpenML 的联合判定规则也未满足;
- 自然语言解释的逐点精度增益未被证实,Tox21/OpenML 种子供体区间均跨零;
- DeepSeek V4 Pro 的匹配/供体卡片将次级 Tox21 漂移降低 64.5%/59.1%,但 V4 Flash 回放使匹配点 MAE 从 .01823 升至 .02020;OpenML 全卡片使 80% 区间名义宽度扩大 21%,覆盖率 49.3% 对 51.4%;
- 研究者手写的机制正控制使点 MAE 降低 2.6 个百分点,说明协议能检测真实增益,但自然解释的信用在所测供体分辨率下仍未被确认。
「研究」频道最新
- 谷歌 RPTune 论文:目录策展+后训练让小商家 LLM 搜索精度提升 31.4 点 — _reachsumit · 2026-10-02
- GrIS 论文:把语义 ID 构建模成图递归划分,统一生成式推荐 — _reachsumit · 2026-10-02
- MatRAG:套娃嵌入层次索引,降低多跳问答检索成本 — _reachsumit · 2026-10-02
- Meta 论文:推荐系统训练中仅 50-60% 时间真正在训练 — _reachsumit · 2026-10-02
- OmniSeek:让全模态大模型学会主动“看与听”检索证据 — Haibo Wang · 2026-10-02
- Netflix 发布口型同步裁判 ATR,七语言基准 AUC 提升 50%+ — netflix · 2026-10-02