开发者吐槽 Sonnet 5.5「很蠢,不是好模型」
D3VAUX · x · 2026-09-29
开发者 D3VAUX 发推直言 Sonnet 5.5 表现很差,「非常愚蠢,不是一个好模型」。与另一位博主在 Bug Hunt Bench 上观察到的 Sonnet 5.5 超长执行表现形成鲜明反差,可视为针对该新模型的第一波负面体感反馈。
「模型」频道最新
- H 公司发布 Holo4 通用电脑操作模型,可跨桌面安卓与 MCP 调工具 — RemiCadene · 2026-09-29
- Bindu Reddy 吐槽 Muse Spark 是过度刷榜的 Claude 蒸馏,不如 DeepSeek Flash — bindureddy · 2026-09-29
- 「控制节奏」成空谈:Anthropic 与 OpenAI 同月连发五个新模型 — XFreeze · 2026-09-29
- OpenAI 内部模型真实研究任务 80% 时间跨度仅约 15 分钟,远低于 METR 数据 — ben_j_todd · 2026-09-29
- 用 Claude 一口气生成讲解 Attention 的完整视频,吃掉 27 万 token 上下文 — Abhishekcur · 2026-09-29
- Gemini 4 Pro 新 checkpoint 现身榜单,爆料称正式版数周内发布 — lyraxana · 2026-09-29