团队提出可规模化方法,评估 LLM 在任意职业上的真实能力
danielrock · x · 2026-09-15
Daniel Rock(《GPTs are GPTs》作者)转发 abhishekn 的帖子:已知 LLM 能力呈「锯齿状」——某些方面很强、某些方面很差。衡量模型对实际工作的胜任度,目前有两条路:一是测抽象能力再映射到真实工作(如 GPTs are GPTs 论文),二是像 OpenAI 的 GDPVal 那样请真人专家针对特定职业做昂贵的人工评估。
他们提出第三条路:能否以可扩展的方式考察模型在任意随机职业上的能力?答案是「可以」,具体方法在后续内容中展开。这条帖子是该方法的开篇预告,核心论点是职业级能力评估可以不再依赖少量职业的人工专家评测。
「研究」频道最新
- ECCV 2026 论文发布 DF3DV-1K 无干扰新视角合成数据集 — rsasaki0109 · 2026-09-15
- 开发者用 Rust 从零写单个 megakernel 实现 Gaussian Splatting CLI — bilawalsidhu · 2026-09-15
- Physical Intelligence 发布 OM-1 机器人基础模型,零样本适配多种机器人 — yifengzhu_ut · 2026-09-15
- 浙江大学发布 Mechanist:让 AI 像神经科学家一样研究自身机制 — jiqizhixin · 2026-09-15
- GlossoGen 框架研究:LLM 智能体何时会发展出人类看不懂的语言 — lucy3_li · 2026-09-15
- 研究者开源 theseus:用人类语言做神经网络架构研究 — pratyusha_PS · 2026-09-15