"模型仍然蠢得惊人":可验证领域的流畅表现让人误判真实水平

generativist · x · 2026-10-06

有开发者观察到,模型在可验证、被大量踩过的领域表现出色,容易让人产生能力幻觉,但接下来一个明显很蠢的失误就会把你从兴奋中惊醒——模型的「锯齿状」能力边界依然显著。这种反差正是当前评估 AI 真实水平时最容易被忽略的一点。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →