有人呼吁给 Opus 5 non-thinking 补跑完整基准
JasonBotterill · x · 2026-07-27
有用户呼吁给 Opus 5(non-thinking) 跑一整套基准测试,认为 Anthropic 没给出充分理由就跳过了这项测试,而这个版本看起来可能是一个很有吸引力的 低价选择。
这条帖子的核心不是闲聊,而是在强调:如果它的非推理模式基准成绩足够好,就可能成为值得认真评估的模型选项。
「模型」频道最新
- 泄露称 Kimi K3.1 接近 GPT-5.6,推理更快还保留开源权重 — iamaliveix · 2026-07-27
- 用户称 Claude 100 美元月付两天就撞上限额 — talkaboutdesign · 2026-07-27
- Meta 据传将推出 harness 和新开源模型 — garrytan · 2026-07-27
- 微软首个文生图模型 192 题评测得 49%,人物真实感最弱 — dh7net · 2026-07-27
- Sonnet 在 192×191×190×…×1 乘法题上直接算崩 — PipeTasty7582 · 2026-07-27
- 用户称 5.6 Sol High 研究能力超过 Fable,月费 23 欧元 — PressPlayPlease7 · 2026-07-27