用三个前沿模型给 50 位科技领袖的思考力打分,LeCun 居首
tonygwu · x · 2026-10-01
作者用 Fable、Astra 和 Gemini 三个模型作为独立评委,基于 653 份逐字转录稿(共约 880 万词)的播客、访谈和演讲,对 50 位科技领袖按「洞察力(45%)、技术与行业深度(35%)、清晰度(20%)」三项加权评分。结果显示 Yann LeCun 排第一,Jeff Bezos 第二,Tim Sweeney 第三,Marc Benioff 垫底(第 50)。
方法论上做了不少认真处理:三位评委独立按 15 项子标准打分,评委间一致性达 0.854;分差小于 4.3 分视为统计意义上的并列;每个分数都附带评委的书面理由和引用证据。代码、评分标准和测试已在 GitHub 开源。
所属事件:三模型盲评 880 万词访谈,LeCun 洞察力居首(3 条相关)→
「Fun」频道最新
- 8 岁小孩给大学生开 2 小时工作坊:从想法到可玩游戏全用 AI — cneuralnetwork · 2026-10-01
- NYT 起诉 OpenAI,自家标题却被曝是 AI 生成的 SEO 文 — TheTuringPost · 2026-10-01
- Grok Bot 藏彩蛋:给帖子点 ❤️ 有惊喜 — soleio · 2026-10-01
- 用 Codex 插件在 Game Boy 硬件上复刻 Minecraft,OpenAI DevDay 名场面 — pvncher · 2026-10-01
- 「FuhuihuaBench」梗基准出炉:最强模型 Pass@16 也为 0 — bowenc0221 · 2026-10-01
- AI 让冰敷拖到进急诊,医生一句热敷次日消肿 — DesireeCachette · 2026-10-01