Martian:跨 44 个 LLM 智能路由,错误率较最强单模型降 46%
HowDevelop · x · 2026-09-07
Martian 发布 AI Frontier 研究,主张「选哪个模型」正从单点对比变成路由问题。
- 标准 benchmark 只测单个模型单次运行,系统性低估 AI 实际能力:每个 benchmark 都错失了大多数模型的能力
- 通过在 44 个 LLM 之间路由请求构建「能力前沿」(Capability Frontier),即在每一成本水平下的最优表现
- 结果:在 16 个最常用 benchmark(TerminalBench、LiveCodeBench 等)上,比最强单一模型错误率低 46%,或在同成本下质量更高
- 团队给出了交互式网站与论文,维度包括质量、可靠性、真实成本与跨任务表现;结论是没有一个模型在所有任务上占优
「编程与Agent」频道最新
- 创业者自述:用 agentic 软件工厂撑起大半个生意 — hugobowne · 2026-09-07
- 从代码小船到 Blender 精细船模:Astra 迭代 3D 资产全过程 — Dimillian · 2026-09-07
- 零代码网友用 ChatGPT+Claude+Gemini CLI 搭出本地隐私 AI 助手 — Particular-Shape1972 · 2026-09-07
- Anthropic 推出免费 4 小时 AI 工程课程,聚焦 Claude 编程实战 — Aiden_Tech_Ai · 2026-09-07
- Conductor 被推荐为可搭配 Claude、Codex、GLM、Kimi 的编码工具 — ayushtweetshere · 2026-09-07
- 结构上杜绝编造引用:开源文献综述流水线放出完整演示视频 — Waste_Public_2985 · 2026-09-07