Inception 发布 Mercury 2.5:最强扩散 LLM,1107 tokens/秒、26 万上下文
StefanoErmon · x · 2026-09-09
Inception Labs 由 CEO Stefano Ermon 宣布发布 Mercury 2.5,称其为目前市场上最强的扩散语言模型,也是已知训练过的最大扩散语言模型。
- 质量:智能较 Mercury 2 提升 40%,对标 GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 等成本优化的前沿模型
- 速度:在通用 NVIDIA GPU 上达 1,107 tokens/秒
- 上下文:260K tokens
- 价格:输入 $0.20/百万 tokens、输出 $0.75/百万;上线期 8 折($0.04 / $0.15)
- 能力:可调推理、并行工具调用、schema 对齐 JSON 输出
Mercury 2 上线以来使用量增长超一个数量级,数千开发者、数十家企业投入生产,覆盖搜索、语音、编码等延迟敏感场景。团队称本代模型基于客户反馈与生产失败案例打磨 eval 与训练方向,NVIDIA 亦表态支持。发布同帖还分享了 OpenCall 用其在真实患者通话上跑语音 Agent、p99 延迟降至 1 秒的案例。
所属事件:Inception 发布扩散语言模型 Mercury 2.5(3 条相关)→
「Infra」频道最新
- 一年半攒下 RTX Pro 6000、双 DGX Spark:本地 AI 算力真实体验 — EAccelerate_42 · 2026-09-09
- Perplexity CEO:推理已大规模迁至 NVLink Blackwell,下一代将上 Vera Rubin — AravSrinivas · 2026-09-09
- 台积电 2030 启用 High-NA EUV,三星 2028 目标 DRAM 应用 — BenBajarin · 2026-09-09
- 分析师称企业云 AI 开销或达本地部署方案的 10-20 倍 — DavidLinthicum · 2026-09-09
- Anthropic 官方指南:三招降低 Claude 成本不损性能 — ClaudeDevs · 2026-09-09
- DisposAI 开源:让本地模型互相当工具,8GB 显存跑通文生图转 3D — Agitated_Complex_628 · 2026-09-09