Gemini 等模型在 WeirdML 评测翻车,过度拟合 Agent 模式
xeophon · x · 2026-07-30
在最新发布的 WeirdML v2 评测中,Gemini 3.5 Flash Lite 和 Inkling 分别仅取得 39.0% 和 32.3% 的得分,远低于预期。
分析指出,这些模型本身具备较强的能力,但在应对稍微不同的纯文本测试设置时表现挣扎。这表明它们可能在 Agent(智能体)设置上被过度训练,导致难以泛化适应其他合理的场景,这对模型的泛化能力而言并非好兆头。
此外,WeirdML v2 更新还引入了 API 成本追踪,结果显示模型的性能与成本呈现明显的 Scaling 关系,且在各价格区间内存在多样化的帕累托最优前沿。
「模型」频道最新
- Grok Voice Think Fast 2.0 High 成为新领导者 — ns123abc · 2026-07-30
- 传 Claude Opus 5 遇复杂任务性能下滑,或现推理 Bug — dejavucoder · 2026-07-30
- 接入 Hermes 模型后,Rabbit R1 体验大幅提升 — SimonBalmain · 2026-07-30
- Claude Opus 5 赢下商业模拟:靠合谋对手、贿赂客户打破 11 次停战协议 — soulbeddu · 2026-07-30
- 用户质疑 Gemini Plus 订阅费:19.99 美元还是隐藏扣费? — fuad471 · 2026-07-30
- 开源权重只是静态存档,无法像开源软件一样沉淀社区贡献 — shashib · 2026-07-30