Rippling 实测:Opus 微弱领先,$7B 收购暗示智能路由价值
serendip-ml · reddit · 2026-08-19
Rippling 对 15 个模型进行了 2100 次真实薪酬工作的基准测试。结果显示:未调优模型成功率约 88.5%-89.5%,Z.ai GLM 5.2 耗费 $621 达到 88.7%,而 Anthropic Opus 4.6 作为唯一经过提示调优的模型达到 91.0%,但花费 $1,453 且仍有 9% 失败率。 weeks 后,Stripe 假设性以 $7B 收购 OpenRouter,后者月处理约 100 万亿 Token,ARR 约 $1.4M。这引发了一个核心问题:未来的 Agent 推理是需要复杂的“思考”,还是主要依赖简单的结构化输出?智能路由究竟是刚需还是伪需求?
「编程与Agent」频道最新
- Gemini 生图在 Hetzner 服务器静默失败,元凶竟是数据中心 IP — dota2dinall · 2026-08-19
- Vercel 开源原生 AI 编程 Agent fx:10µs 冷启动 — Rasmic · 2026-08-19
- Grok 开源版文件上传服务 Byteship 发布 — jasonkneen · 2026-08-19
- ClawGym II 论文:混合跨工具训练 Agent — omarsar0 · 2026-08-19
- MacStories 发布 Codex 自动化指南:处理笔记、邮件与稍后读 — Dimillian · 2026-08-19
- 研究揭示上下文压缩致 Agent 调用增加三倍 — dair_ai · 2026-08-19