Claude Opus 5 上线,Box 说企业 agent 任务大幅提升
inductionheads · x · 2026-07-25
Anthropic 的 Claude Opus 5 被 Box 的实测描述为相较 Opus 4.8 的明显跃升,尤其是在企业文档型 agent 任务上。
- Box 在自家 Complex Work Eval 上测试了 Opus 5,称它在复杂、非结构化的端到端企业任务里有明显提升。
- 例子包括:尽调任务 +17%,生命科学目标识别 +30%。
- 配图里的官方图表显示,Opus 5 在 agentic terminal coding、knowledge work、search、computer use、business workflows、biology 等项目上都处于前列,同时系统卡还强调了对齐与安全表现。
- 转述的官方信息称,Opus 5 已在 Claude Code / API 中上线,模型名为 claude-opus-5,价格与 Opus 4.8 相同。
「模型」频道最新
- 前端测试里,GPT-5.6 的落地页质感胜过 Claude Opus 5 — Arindam_1729 · 2026-07-25
- Claude Opus 5 疑似曝光:具备自我纠错与执行能力 — mathemagic1an · 2026-07-25
- Google 因 Gemma 表现和开源立场遭质疑 — BoogerheadCult · 2026-07-25
- 马斯克称 Grok 4.6 两周后、4.7 四周后发布 — elonmusk · 2026-07-25
- Together 称 Kimi K3 以 35% 价格逼近 Claude Fable 5 编码能力 — togethercompute · 2026-07-25
- 马斯克称 Grok 4.5 与 Opus 5 同列帕累托前沿 — elonmusk · 2026-07-25