ORQA 论文:116 个职业实测 LLM 专业知识,前沿模型仅得约六成
soumitrashukla9 · x · 2026-09-15
- 新工作论文 ORQA(Occupation-Realistic QA)提出可规模化测试 LLM 职业知识的方法:将 ONET 职业对接监管机构、执照组织等专业网站,自动管线+人工审核生成可溯源的问答对,覆盖 SOC 全部 21 大类的 116 个职业、480 道题,来源 187 个网站。
- 实测 15 个前沿与开源权重模型:Claude Opus 4.6、GPT-5.4、Claude Sonnet 4.6 最佳,约 58-62%;小型开源模型仅 33-41%。
- 不同职业差异显著:医疗相关职业最高(78%),办公与行政支持类最低(约 40%)。附论文与 dashboard 链接。
「漫话AGI」频道最新
- 微软"AI 绝对无意识"表态被批逻辑不自洽 — rgblong · 2026-09-15
- "Twitter 没有这种过滤器":Transformer 门槛论引热议 — generativist · 2026-09-15
- 画不出 Transformer 架构图,就别对 AI 高谈阔论? — generativist · 2026-09-15
- AI 实验室是否只为逐利?Thom Wolf 与研究员激辩前沿公司初衷 — mervenoyann · 2026-09-15
- 学者朱科航加入斯坦福数字经济实验室,用 AI 智能体模拟经济 — soumitrashukla9 · 2026-09-15
- 5 分钟视频推演 AI 灭亡场景:无需失控 AI,人类一步步交出控制权 — ronbodkin · 2026-09-15