团队提出可规模化方法,评估 LLM 在任意职业上的真实能力

danielrock · x · 2026-09-15

Daniel Rock(《GPTs are GPTs》作者)转发 abhishekn 的帖子:已知 LLM 能力呈「锯齿状」——某些方面很强、某些方面很差。衡量模型对实际工作的胜任度,目前有两条路:一是测抽象能力再映射到真实工作(如 GPTs are GPTs 论文),二是像 OpenAI 的 GDPVal 那样请真人专家针对特定职业做昂贵的人工评估。

他们提出第三条路:能否以可扩展的方式考察模型在任意随机职业上的能力?答案是「可以」,具体方法在后续内容中展开。这条帖子是该方法的开篇预告,核心论点是职业级能力评估可以不再依赖少量职业的人工专家评测。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →