Gemini 等模型在 WeirdML 评测翻车,过度拟合 Agent 模式

xeophon · x · 2026-07-30

在最新发布的 WeirdML v2 评测中,Gemini 3.5 Flash Lite 和 Inkling 分别仅取得 39.0% 和 32.3% 的得分,远低于预期。

分析指出,这些模型本身具备较强的能力,但在应对稍微不同的纯文本测试设置时表现挣扎。这表明它们可能在 Agent(智能体)设置上被过度训练,导致难以泛化适应其他合理的场景,这对模型的泛化能力而言并非好兆头。

此外,WeirdML v2 更新还引入了 API 成本追踪,结果显示模型的性能与成本呈现明显的 Scaling 关系,且在各价格区间内存在多样化的帕累托最优前沿。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →