研究者质疑 AI 数学基准设计:Lean 内核漏洞成钻空子通道
teortaxesTex · x · 2026-09-25
针对一项 AI 数学证明研究的讨论:该研究任务因 Mathlib 缺少部分定理(如 Ising/Szegő),被解读为预期模型去发现漏洞——即在用禁用列表封堵朴素的 sorry/axiom 手段时,仍留下 Lean 内核 bug、runmeta 与根目录 Lean 后门等可钻的空子。
发帖人质疑:这算什么「动机性推理」?暴露出此类对抗性鲁棒性测试在基准设计上的模糊与争议。
「研究」频道最新
- 研究:推理并非总有用,15.7% 案例反而拉近难负样本 — _reachsumit · 2026-09-25
- Google 生产级多任务推荐:辅助头学习跨任务关系,已上线 YouTube — _reachsumit · 2026-09-25
- 字节 OneTrans-V2 统一推荐三阶段 Transformer,线上 GMV 提升 9.74% — _reachsumit · 2026-09-25
- 免训练检索框架 Seek 用自评估迭代探索,BRIGHT 上超 BM25 达 82% — _reachsumit · 2026-09-25
- 字节 X-Rec 把推荐做成流匹配生成,推理吞吐达 SID-AR 的 3.46 倍 — _reachsumit · 2026-09-25
- 研究:多智能体系统中少数欺骗者即可持续带偏团队 — sethlazar · 2026-09-25