Bindu Reddy 断言现有 AI 基准全失效 将推新测试

bindureddy · x · 2026-09-04

Bindu Reddy(Abacus.AI)表示,当前所有 AI 基准测试「已完全损坏或饱和」,根本原因是它们不测试真实世界的长时间运行循环。她预告下周将发布一个修复该问题的新基准,并称随着模型能力提升,基准体系需要全面改版。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →