CodeRabbit 说 Opus 5 更少说错,但每次调用吞掉更多 token
socialwithaayan · x · 2026-07-27
这条长线程的核心观点是:模型评测本身不够,必须再加一层验证机制。
- 线程称,CodeRabbit 在真实 pull request 上测试了 Opus 5,结果显示它比 GPT-5.6 Sol 更少说错,但也会漏掉更多 bug。
- 同时它还指出,Opus 5 每次调用大约会多读 50%、多写 65% 的 token,所以贵的不只是单价,而是整体调用量。
- 作者给出的工作流是:先把待发布内容拆成独立 claim,再逐条找最强反驳,最后做来源核查,避免“自信地错”。
- 线程末尾还给出一个内容生产提示词:先读 5 条高表现帖子,提炼写作模式,再按该模式批量生成。
「编程与Agent」频道最新
- 月之暗面开源 AgentENV,面向大规模智能体训练 — teortaxesTex · 2026-07-27
- Moonshot 在 Hugging Face 发布 2.8T 开源多模态 Kimi K3 — iamfakhrealam · 2026-07-27
- 一条 Claude Opus 5 提示,21 小时做出可玩生日游戏 — mattshumer_ · 2026-07-27
- 一个新 skill 把 CLAUDE.md 杂乱内容削减 50% — iamrobotbear · 2026-07-27
- Anthropic 为 Claude Code 推出多智能体安全插件 beta — thione · 2026-07-27
- Poolside 发布 100 万 token 上下文的开源代码模型 — thione · 2026-07-27