Yoav Goldberg 澄清:不是过拟合测试集,是为任务大规模训练
yoavgo · x · 2026-09-14
AI 研究者 Yoav Goldberg(yoavgo)在讨论中澄清自己的观点:他并未说模型"过拟合测试集",而是认为这些模型"为这类任务而训练"——很可能在超大规模上专门训练过;同时他也认为模型在这类任务上可能有不错的泛化能力。这一表态针对的是围绕基准成绩是否反映真实能力的常见争论。
「模型」频道最新
- Agent 轨迹数据集月下载超 5 万,作者猜被用于 SFT 与奖励作弊监测 — maksym_andr · 2026-09-14
- 作家实测:Gemini 查引文来源「稳定地」给错答案,两测两错 — danbri · 2026-09-14
- 开源插件 Astrable:让 GPT-6 Astra 指挥 Claude Fable 写代码 — daniel_mac8 · 2026-09-14
- GPT-Live-1 实测:语音自然但指令遵循频频翻车 — kolchinski · 2026-09-14
- "给前沿模型降级用":Astra medium 跑简单任务成新梗 — danshipper · 2026-09-14
- Grok-4.6 曝光:跨 ARC-AGI 各代测试泛化表现出色 — zainhas · 2026-09-14