计数字母暴露短板:GPT-6-Astra 93% 对手惨败
scaling01 · x · 2026-09-18
- 网友设计了一个极简但 out-of-distribution 的测试:让前沿 LLM 数文本段落中的字母。
- 这类任务被 SWE-Bench、TerminalBench 等基准「养偏」的模型很少训练,结果出现巨大分化:低推理档位下 GPT-6-Astra 在 1280 字符时仍保持 93% 准确率,而 Fable 5.1 表现惨淡。
- 说明基准刷分与真实基础能力之间存在盲区,简单任务也能拉开模型差距。
「模型」频道最新
- 传三名黑客用「松绑版」Opus 5 入侵 OpenAI 内部代码库 — teortaxesTex · 2026-09-18
- 网易有道开源流式 ASR 模型 Confucius4-R2T2,永不改写已提交文本 — rohanpaul_ai · 2026-09-18
- 用 Gradio 把 4B 小模型微调成答案打分器,温度缩放校准置信度 — Gradio · 2026-09-18
- 网友拆解 Astra 生成 ASCII 艺术:疑似程序化坐标作画而非 SVG — MoonL88537 · 2026-09-18
- 研究者公开道歉承认榜单提交违规,承诺按规则重跑模型 — AlbertQJiang · 2026-09-18
- Noam Brown 上 Dwarkesh 播客谈安全,被指「吓坏所有人」 — Apprehensive_Sand951 · 2026-09-18