TypesafeAI 预告弃用公开评测:榜单在奖励作恶者
hardimanjames · x · 2026-09-17
初创模型公司 TypesafeAI 的人公开表示,公众觉得模型聪明(公开评测表现好)并不是好信号,因为公开评测体系会奖励 bad actors。团队已预先承诺降低公开评测的权重——即使成绩好看也不强调,选择用真实可靠性「笨办法」长期建立信任。帖子本身是营销口吻,但引用内容反映了小实验室对评测文化与信任建立的立场。
「模型」频道最新
- 神秘模型 Union Alpha 跑分 74 分平 GPT-6,被指 DeepSWE 已饱和 — brandon_galang · 2026-09-17
- GPT-6 Astra 的 Epoch ECI 得分下修,长周期软件工程任务是短板 — Jsevillamol · 2026-09-17
- 黄仁勋:AI 领导力不属于少数公司,开源闭源都重要 — NVIDIAAI · 2026-09-17
- 神秘模型 Jev 概率校准出色:基准平均误差仅 1.74 个百分点 — hackgoofer · 2026-09-17
- 研究员筛选合成环境:Qwen 必败而 GLM5.3 能解,发现有趣行为倾向 — kalomaze · 2026-09-17
- 为何 2026 年还留非思考模式?CoT 监控与性能双双要推理 — scaling01 · 2026-09-17