Opus 5 代码审计实测:百万上下文与高成本并存

Opus 5 在代码审计和深度研究方面展现出强大能力,支持 100 万上下文,在 BrowseComp 达到 90.8% 得分,ARC-AGI-3 解题能力也成倍提升。然而 CodeRabbit 在真实 pull request 上的实测发现,该模型虽然出错更少,但每次调用会消耗更多 token。这表明仅靠模型评测不够,实际应用中仍需引入额外的验证机制来平衡性能与成本。

2026-07-27 ~ 2026-07-27 · 2 条相关