FrontierFinance 评测:Fable 5.1 跃居榜首,成本增加 1.7 倍
maithra_raghu · x · 2026-09-02
与 Anthropic 合作在 FrontierFinance 上对 Fable 5.1 进行预发布评测。结果显示,Fable 5.1 以 55.9% 的分数成为表现最佳的前沿模型,远超前代 Fable 5 (49.2%)。性能提升主要得益于更多且更优的工具调用和对权威来源的锚定。然而,性能提升伴随着约 1.7 倍的成本增加。
「编程与Agent」频道最新
- Claude 联手 Thrixel,单条指令生成完整 Roblox 游戏 — RanaHanocka · 2026-09-02
- Vespper 推出 DOCX MCP,智能体文档处理更快更准 — ycombinator · 2026-09-02
- 开源 Reef:让 Agent 推理时持续自我进化的基础设施 — pliang279 · 2026-09-02
- Agent 无限重试烧钱 16 小时?作者复盘并开源耐用型运行时 — slateraligator · 2026-09-02
- 同模型同指令下,Copilot 与 Claude Code 谁更省 Token? — alex_bababu · 2026-09-02
- AI Agent 总写死代码?这个 7 秒检查步骤完美解决 — timhartmann7 · 2026-09-02