评测即训练数据:研究者主张为 LLM 设计高度专门的测试
rmcwhorter99 · x · 2026-10-01
rmcwhorter99 在关于 LLM 评测的讨论中提出:用于评测 LLM 的测试本身也会成为 LLM 的训练数据,因此评测项目应当「高度专门化」(hyperspecific)。
理由是:既然团队对想提升的具体能力(例如用 Lean 写证明)本身就有高度明确的目标,那么测试就应该同样具体。这带来一个额外好处——可以把模型在特定能力上的提升归因到特定的训练材料上,形成可追踪的改进闭环。
所属事件:研究者主张 LLM 评测应高度专门化(2 条相关)→
「模型」频道最新
- Gemini 4 argon 对比 GPT 6.1 sol:同 prompt 实测结果差异明显 — iamfakhrealam · 2026-10-01
- Claude 高推理档位 token 爆量烧钱,除非确需否则保持 medium — intellectronica · 2026-10-01
- Technion 提出误导图像压力测试:13 个 VLM 评审近两成标签被无关图片动摇 — Technion · 2026-10-01
- 传 Gemini 4 Argon 输出上限达百万 token,是飞跃还是营销 — minimanishtic · 2026-10-01
- 付费用户曝 ChatGPT Projects 旧对话大面积无法加载,担忧工作记录丢失 — yaxir · 2026-10-01
- 开发者再遇 OpenAI usage 接口故障,ChatGPT 登录凭证被拒 — lucasmeijer · 2026-10-01