安全研究者讥讽对手连 eval 都跑不对,「跑错评测基准」成互相攻击靶点
nptacek · x · 2026-09-19
安全研究员 Nicholas Ptacek 在 X 上连发两条嘲讽 @danlahav 团队:「你们在『连一个 eval 都跑不对』这个 benchmark 上表现很棒,是不是要拿满分了?」这是 AI 圈关于评测正确性争议的公开互怼,针对对方是否正确运行了 eval。帖子本身是骂战,具体争议背景信息有限,但反映了 AI 安全/评测圈对 eval 严谨性的公开冲突。
「Fun」频道最新
- 网友调侃:下一个 Claude 模型就叫 Madoff 吧 — pastramimachine · 2026-09-19
- 网友讽 AI 共情新底线:「扮演受苦的演员」 — rickasaurus · 2026-09-19
- Gary Marcus 讽 Anthropic:呼吁 AI 放缓,转身就备新模型迎战 OpenAI — GaryMarcus · 2026-09-19
- Sentdex 试玩 DeepSeek 新模型,自嘲「像背叛了 GLM」 — Sentdex · 2026-09-19
- Claude Opus 的复数该怎么写?大佬:「Claude Opera」 — moyix · 2026-09-19
- 动物开车视频看腻了?现在轮到木偶开车了 — bennash · 2026-09-19