有人提议先做一个“评测基准的基准”
DevToD4 · x · 2026-07-24
这条帖子的观点是:AI 圈应该先做一个“评测基准的基准”,也就是先检验这些 benchmark 本身是否靠谱,再拿它们去评模型。
它讨论的是当前 AI 评测体系的元问题:不是某个模型或产品,而是“评测是否真的在评到该评的东西”。
「漫话AGI」频道最新
- Tsimerman 说 AI 可能迫使数学转向人类解题之外 — burny_tech · 2026-07-24
- 一文拆解 10 种 AI Agent:从反应式到多智能体系统 — goyalshaliniuk · 2026-07-24
- Reddit 讨论:AI 数学证明会不会推翻“只会曲线拟合” — Aggressive_Fig7115 · 2026-07-24
- AI 安全讨论该走出“高级自动补全”稻草人 — GarrisonLovely · 2026-07-24
- 一张梗图把“让魔法可用”当成 ASI 对齐方案 — RhinigtasSalvex · 2026-07-24
- LLM 已能解未解数学题,苦涩教训再度应验 — haider1 · 2026-07-24