Celeris-1 Magnus 登场:称霸 τ³-bench 的 Agent 专用模型
timshi_ai · x · 2026-09-01
Celeris 发布 Celeris-1 Magnus 模型,专为智能体工作负载优化。在 τ³-bench 银行业 97 项任务中,该模型以 41.2% 的解决率超过 GPT-5.6-sol 的 38.1%,且任务中位数耗时仅 55 秒,快于竞争对手。Magnus 是基于 Qwen3.8-27b 衍生的混合扩散模型,支持推理开关,开启思考模式下性能提升 13.4 分。API 兼容 OpenAI,开发者无需修改 Agent 代码即可替换使用。
「编程与Agent」频道最新
- 开发者质疑 MCP 规范:只是 JSON-RPC 的复杂封装? — PaulMorel · 2026-09-01
- VibeKit MCP 服务器:支持部署监控与无头编码 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- 大数据集 MCP 服务器如何避免上下文窗口瓶颈 — JuicerSocial · 2026-09-01
- 把LLM引用当监控数据:用Grok Bot做AI搜索排名 — rohanpaul_ai · 2026-09-01
- 搜索配置比模型选型更能影响 Agent 准确率 — RichardSocher · 2026-09-01