评测即训练数据:研究者主张为 LLM 设计高度专门的测试

rmcwhorter99 · x · 2026-10-01

rmcwhorter99 在关于 LLM 评测的讨论中提出:用于评测 LLM 的测试本身也会成为 LLM 的训练数据,因此评测项目应当「高度专门化」(hyperspecific)。

理由是:既然团队对想提升的具体能力(例如用 Lean 写证明)本身就有高度明确的目标,那么测试就应该同样具体。这带来一个额外好处——可以把模型在特定能力上的提升归因到特定的训练材料上,形成可追踪的改进闭环。

所属事件:研究者主张 LLM 评测应高度专门化(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →