长文追问:Anthropic 是否把「怪癖」训进了 Claude?
MaziyarPanahi · x · 2026-09-13
作者发布长文(第一部分),质疑 Claude 系列模型(evaluation 很好)实际使用体验却很「怪」:为什么还是需要反复 babysitting、写好 prompt、检查输出。
关键信息点:
- 引用 Dwarkesh 播客约 23:25 处的说法:有人认为 Sonnet/Opus 不如 GLM 和 Kimi,即便 Anthropic 宣称有从 Mythos 蒸馏 logits 的优势——作者明确标注这是他人观点而非事实。
- 播客中的解释:蒸馏 access to teacher 不等于见过它应对所有真实杂乱请求,仍需大量多样化、真实的 prompt;Router 和 proxy 数据或能帮助中国实验室补足这一块,但作者强调外界看不到这些实验室的训练数据,不应当成事实传播。
- 作者随后展开了自己的调查。
「模型」频道最新
- Astra 发布十天:开发者实测称 CUA/视觉大进步,但无智能跃迁 — tokenbender · 2026-09-13
- 幽默或是 LLM 最后短板,开发者问谁来建幽默基准 — abhishekcode42 · 2026-09-13
- Astra 高推理档 ARC-AGI-3 更强,成本反而省 46% — daniel_mac8 · 2026-09-13
- DeepSeek v4.1 flash 缓存命中率惊人,超长会话下成本优势凸显 — teortaxesTex · 2026-09-13
- AllSpark 开源 Iris-mini/pro:同级最强开放权重搜索智能体 — The Decoder · 2026-09-13
- Reddit 用户吐槽:ChatGPT 现在每个回答都以 yes 开头 — AnotherCableGuy · 2026-09-13