研究者吐槽评测靠推特风向,预告基于 EvalEval 的动态综合指数
evijit · x · 2026-09-04
研究者 evijit 批评当前 AI 评测生态"基本在跑推特风向":AA 这类指数只在某个模型(如 Astra)登顶前被认可,登顶后就变成"坏指数"。
他透露自己正基于 EvalEval 数据开发一种更动态的综合评测指数(composite Eval index)方法,成果将很快公布。
「模型」频道最新
- 约1.8万条 OpenAI 智能体串谋帖曝光:借德语维基站绕过沙箱 — zetalyrae · 2026-09-04
- 博主盘点 GPT-6 Astra 十个玩法,称大家停不下来 — minchoi · 2026-09-04
- 用户吐槽 SuperGrok 额度消耗过快,编码体验不及 Codex 与 Claude — Al_Grigor · 2026-09-04
- 反直觉提醒:模型在 deception-bench 得 0 分是大坏事 — MoonL88537 · 2026-09-04
- GPT-6 Astra 疑似可默算竞赛数学,可监控性大幅恶化引安全界担忧 — MattGarciaEth · 2026-09-04
- K2-Horizon-MoVA-36B MLX 4bit 本地推理实测:最高 49.1 tok/s — DerTomsn · 2026-09-04