ARGUS 用 LLM 审计气候政策研究的因果识别假设,缺陷检出率 73%
Yonghong Zhang · hf · 2026-09-28
Yonghong Zhang 发布 ARGUS,一个用大模型审计气候政策因果评估(DID 研究)识别假设证据的自动化管线。
- 方法:按"假设-推论-证据"的 11 维度评分表,将论文报告的证据与结构化标准逐项比对;无法检索到相关证据时主动弃权,不强行下结论
- 效果:在注入 11 类缺陷的基准上检出 73% 的植入缺陷,关键词基线仅为 18%;对 26 篇经济学论文,约 40% 的论文-维度评估因证据不足而弃权
- 诚实评估:在 5 篇论文的双标注者试点中,ARGUS 在完成的 33 项评估里有 25 项给出比标签更高的风险等级;预注册规则可消除大部分这种样本内偏差,但加权一致性仍偏低
ARGUS 输出带证据链接的风险报告,为专家复核定位潜在弱点,不直接裁决因果结论。代码与数据已开源。
「研究」频道最新
- 神经科学家驳「AI 非大脑」论:前沿模型表征已可预测灵长类皮层活动 — coherence · 2026-09-28
- ESPnet 发布百万级语音数据集 YODAS3,覆盖识别、翻译与合成 — espnet · 2026-09-28
- BoundInk 把字间边界作为显式生成单元,在线手写生成质量大幅提升 — SUNGKYUNARCH · 2026-09-28
- TUM 提出 Continuous Depth Batching,循环语言模型自适应推理提速 99% — TUM · 2026-09-28
- 用范畴论给深度学习画图:PyNCD 把 FlashAttention 画在餐巾上 — GioeleZardini · 2026-09-28
- 交互式实验室手动选下一个词,直观演示采样与温度机制 — CurieuxExplorer · 2026-09-28