"模型仍然蠢得惊人":可验证领域的流畅表现让人误判真实水平
generativist · x · 2026-10-06
有开发者观察到,模型在可验证、被大量踩过的领域表现出色,容易让人产生能力幻觉,但接下来一个明显很蠢的失误就会把你从兴奋中惊醒——模型的「锯齿状」能力边界依然显著。这种反差正是当前评估 AI 真实水平时最容易被忽略的一点。
「模型」频道最新
- 实测称 ChatGPT 6 Astra 中档档位比 Ultra 更耗用量额度 — ChrisUniverse · 2026-10-06
- ChatGPT 付费用户为 Claude 和 Gemini 3 倍,Claude 消费端增长放缓 — FinanceYF5 · 2026-10-06
- 开发者晒 3 万亿 token 用量:9 月烧掉 842B,API 牌价 40.9 万美元订阅仅付 3.4% — doodlestein · 2026-10-06
- 「击杀」AI 检测器 Pangram 后,人味化模型 Super 高调发布 — menhguin · 2026-10-06
- Reflection 新模型以 Apache 2.0 开源,但预训练 MFU 仅约 12% 引质疑 — eliebakouch · 2026-10-06
- 新论文解谜 Olmo 3 训练:短上下文相当的两模型长上下文表现迥异 — kylelostat · 2026-10-06