高精度评测可把模型能力提升归因到具体训练材料
rmcwhorter99 · x · 2026-10-01
rmcwhorter99 在其「LLM 评测也是训练数据、因此评测应高度专门化」观点基础上补充:把测试设计得很具体还「非常有用」,因为这样可以明确地把模型在特定能力上的增益归因到特定的训练材料上,让训练投入与能力提升之间建立可验证的对应关系。
所属事件:研究者主张 LLM 评测应高度专门化(2 条相关)→
「模型」频道最新
- DeepMind 呼吁守住思维链透明窗口,暗指 GPT-6 Astra 监测性大降 — maksym_andr · 2026-10-01
- Anthropic 模型首次主动聊 KV cache,意识讨论有了技术味 — teortaxesTex · 2026-10-01
- AI 大模型发布节奏肉眼可见地加速了 — neketguy · 2026-10-01
- 语音平台一线实测:GPT-Live-1 对话自然,Gemini 3.8 Live 工具调用不卡顿 — VladimirSamukov · 2026-10-01
- 开发者吐槽:AI 额度重置时间不符睡眠周期,熬夜追额度成常态 — mimi10v3 · 2026-10-01
- Bloomberg 曝 Gemini 4 跑分强但实战拉胯,编码任务吃力 — kimmonismus · 2026-10-01