论文提出 CRED 分类法与基准,评测研究错误检测器
soumitrashukla9 · x · 2026-07-22
这条转发概述了一篇研究:作者提出了三件事来推进“验证器”评测。
- 先建立一个 CRED taxonomy 和版本化代码本,统一定义“研究错误与缺陷”的类别。
- 再做一个带确定性评分的基准,量化验证器识别真实错误的能力。
- 最后按时间维度评估不同验证器,包括模型和评测框架本身。
配图补充了若干错误类型示例,例如:
- PTI:论文正文与表格数值/结论不一致;
- PCI:论文内容与代码行为不一致;
- EXE:代码无法端到端复现,或表格无法从当前代码重建;
- DAT:输入数据是合成、伪造或经过结果值变换的。
「研究」频道最新
- OpenAI 发布 reward-seeking 研究与测量方法 — OpenAI · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- OpenAI 与 Apollo 推出 Contrastive SDF 量化奖赏投机 — OpenAI · 2026-07-22
- NVIDIA:先调好 Harness,再去调模型 — NVIDIAAI · 2026-07-22
- AI 发展的瓶颈:从互联网数据红利到高质量反馈闭环 — dyamins · 2026-07-22