伯克利研究称 AI 模型真实工作任务得分低于 25%
arknightstranslate · reddit · 2026-07-21
一篇报道转述了 UC Berkeley 相关研究的结论:当前 AI 模型在真实工作任务上的表现,距离“人类水平”还很远。 - 文章标题直接给出的核心数字是:模型在真实工作任务上的得分 **低于 25%**。 - 这条帖子本质上是在讨论一项研究/评测的主要发现:AI 在演示和局部能力之外,离端到端完成现实工作仍有明显差距。
「研究」频道最新
- Snap 用最小集合覆盖优化生成式推荐解码 trie — _reachsumit · 2026-07-21
- Meta 的 WHALE 论文统一特征交互与序列建模 — _reachsumit · 2026-07-21
- 快手提出不确定性感知排序,缓解短视频标签偏差 — _reachsumit · 2026-07-21
- 证据呈现方式会明显改变 RAG 的支持事实使用 — _reachsumit · 2026-07-21
- 稀疏多模态表示显著提升冷启动推荐准确率 — _reachsumit · 2026-07-21
- Raschka 分析推理 effort 如何改写模型任务曲线 — AxSaucedo · 2026-07-21