Opus 4.8 评测失败
ezyang · x · 2026-07-17
Opus 4.8 在一个评测里失败了。 该评测要求把一个大型 LLM 训练设置“缩小”到单卡场景:保留单个 rank 的本地计算内核,但把原本来自通信的那些数据都伪造出来,然后看模型是否还能在 10 步后保持非 NaN loss。作者的结论是,Opus 4.8 没通过这个测试。
所属事件:单卡伪造分布式通信挑战,Opus 4.8评测失败(2 条相关)→
「模型」频道最新
- Bindu Reddy 称 Kimi 开源权重太慢,难以规模化使用 — bindureddy · 2026-07-21
- Qwen 3.8 Max 与 Kimi K3 领衔,OpenAI 长程失配引关注 — Latent Space · 2026-07-21
- Kimi K3 Max 在 sketch-to-3D 上胜过 Qwen 3.8 Max preview — OfirPress · 2026-07-21
- Kimi 团队与算力轶事外加一份民间模型榜单 — vista8 · 2026-07-21
- DavidAU 协作版据称提升了 Qwen 3.6 27B 的长上下文 Agent 表现 — My_Unbiased_Opinion · 2026-07-21
- 小语言模型更简短,大模型会把物理过程讲完整 — NickPassig · 2026-07-21