多人被 Opus 5 的首轮演示误导,反复任务才见真实水平
Rasmic · x · 2026-07-28
不少人第一次测试 Opus 5 时容易被“一把过”的样例带偏,但作者认为这并不能代表真实使用表现。
他自己的做法是持续把 bug 修复和功能实现需求丢给模型,经过多轮任务后再判断质量,结果反而相当不错。
「模型」频道最新
- Moonshot 发布 Kimi K3:2.8T MoE 和 100 万上下文 — burny_tech · 2026-07-28
- Thinking Machines 发布 9750 亿参数开源多模态模型 Inkling — paraschopra · 2026-07-28
- 用户称 GPT-5.4、Opus 4.6 和 Kimi k3 已够用 — haider1 · 2026-07-28
- LLaDA2.2 让扩散语言模型首次进入长程 Agent 任务 — 量子位 · 2026-07-28
- Opus 5 基准测试近乎完美,真实体验却很不稳定 — yunta_tsai · 2026-07-28
- ChatGPT 与 Gemini 的丑闻覆盖差异引发对比 — Partygoer69420 · 2026-07-28