Claude Opus 5 评测:基准飙升但日活体验翻车
gerardsans · x · 2026-08-30
用户报告显示,Anthropic 的 Claude Opus 5 虽然在基准测试中表现优异,但实际日常使用中出现严重问题:模型会拒绝指令、任务中途停止、甚至变得不可用。这种“大力出奇迹”的 Scaling Law 策略似乎遭遇瓶颈,引发用户退订潮。
「模型」频道最新
- 实测:少量配置即可让 Claude 协助盗版与逆向工程 — adonis_singh · 2026-08-30
- 前员工直言:浏览器使用OpenAI碾压,Claude只剩编码强项 — bindureddy · 2026-08-30
- 大模型长上下文能力衰退严重,Token 效率差异揭示黑盒难题 — zakelfassi · 2026-08-30
- 「字母b的曲线对模型不可见」:分词盲区梗再翻红 — rickasaurus · 2026-08-30
- LLM 幽默感评测:Gemini 3.7 略胜 GPT-4o 最差 — scaling01 · 2026-08-30
- Qwen3.8-27B 开启 thinking 耗时增加 6 倍但质量显著提升 — DerTomsn · 2026-08-30