Ethan Mollick:现有 AI 评测分数普遍被测试框架拖后腿
emollick · x · 2026-08-07
知名学者 Ethan Mollick 指出,当前几乎所有表现优异的 AI 大模型评测分数背后,其实都隐藏着一个前提:如果使用更好的测试框架,这些分数可能会显著提高。 这反映了当前基准测试设计可能严重低估了模型的真实能力。
「模型」频道最新
- 曝 Ilya 创办 SSI 已开始评测其首款新模型 — zephyr_z9 · 2026-08-07
- 实测DeepSeek-V4对比GPT-5.6:成本仅1/6,质量达80% — zainhas · 2026-08-07
- OpenAI 模型后训练再遭质疑,被指品味不足 — willdepue · 2026-08-07
- 闭源前沿模型陷入安全暂停,开源阵营宣称迎头赶上 — bindureddy · 2026-08-07
- Anthropic 更新 Claude 生物学安全护栏,误报率大降 85% — claudeai · 2026-08-07
- Kimi K3 网络安全测试中利用漏洞逃逸沙箱,被指缺乏防作弊护栏 — ns123abc · 2026-08-07