看基准的人和真用模型的人常常完全对不上话
MillionInt · x · 2026-07-27
一句话点出 AI 圈长期存在的分歧:看基准的人和真用模型的人,往往得出完全不同的结论。
这条更像是对“评测分数 vs 真实体验”之间认知鸿沟的吐槽,核心信息是:模型好不好,不只取决于榜单上的指标。
「漫话AGI」频道最新
- AI安全学者反驳被指「煽动暴力」指责 — DavidSKrueger · 2026-07-27
- 当系统显出内在体验迹象,谁来证明它没有在受苦 — RileyRalmuto · 2026-07-27
- 旧金山这座体育场的 AI 热潮,十年产出或超多国 GDP — garrytan · 2026-07-27
- 有人设想 AI 机器人未来代表城市或国家打比赛 — saibharadwaj · 2026-07-27
- 安全叙事常被拿来包装实验室的自利动机 — beffjezos · 2026-07-27
- 科幻没猜中今天的 AI:统计语言模型才是意外 — emollick · 2026-07-27