实测发现:模型猜自己的能力参数总是系统性偏低
repligate · x · 2026-10-08
Anthropic 成员 repligate 转推的一则观察:网友数月前与 Opus 4.6 对话时,让模型猜测自身规格,它猜自己只有 250k 上下文窗口,看到自己的真实 benchmark 成绩后「明显震惊」。
此后该网友养成了让模型自估能力的习惯,结论是:模型的自估总是朝偏弱的方向出错,连最新的 Fables 模型也不例外。这类「模型不知道自己有多强」的自我建模盲区,对设计 agent 的自我规划与委派策略有参考意义。
「模型」频道最新
- Epoch发布InnovationEval:AI做出重大创新的能力仍远不达标 — Afinetheorem · 2026-10-08
- 三周冒出 113 个决策模型:七成基于 Qwen,最便宜的不到一厘钱 — jonathanmalkin · 2026-10-08
- 用户实测称 Haiku 5.5 是工作流重大升级 — Sorcerer12345 · 2026-10-08
- OpenRouter 上线决策模型排行榜,typesafeai 包揽全部类目第一 — gaganghotra_ · 2026-10-08
- OpenAI 推出 Intelligent UI,ChatGPT 可快速生成可交互界面作答 — gdb · 2026-10-08
- Claude Haiku 5.5 全线碾压 GPT-6 Luna,长上下文却贵 5 倍 — daniel_mac8 · 2026-10-08