Claude Opus 5.5 登顶 SimpleBench,小米 MiMo-V2.6-Pro 开源逼近闭源
Latent Space · rss · 2026-09-25
Latent Space 本期 AINews 梳理一周 AI 动态,要点:
模型浪潮
- Claude Opus 5.5 以 88.4% 领跑 SimpleBench,被评为 Anthropic 迄今最强视觉模型,价格比 Fable 5.1 低约 60%;推理力度在 Terminal-Bench-Science 上从 low 24% 升至 xhigh 62%,但 max 反降到 59%。
- Gemini 3.8 Flash:AA 智能指数 41 分、291 tok/s、1M 上下文,Cline 中免费;ARC-AGI v2 得 89.2%,v3 标准测试仅 10.4%(provider harness 下 35%)。
- 小米 MiMo-V2.6-Pro 以 MIT 协议开源,全模态、1M 上下文,AA 指数 46 分仅次 GPT-5.6 Sol 的 47,成本 $0.13 vs $1.99,并开源了 RL 代码与训练环境;但其 RL 增益在更难数学评测上不泛化。
- GPT-6 Astra 三次尝试内通关 NetHack;Grok 4.7 亮相 Agent Arena 第 16 位。
「System One」决策模型
- TypeSafe 的 Jev 用 RL 训练输出带概率的类型化决策,每千次判断 $0.044、中位延迟 152ms,比 GPT-6 便宜约 277 倍;低置信度升级到 GPT-6 Astra 的级联可保留 99% 精度、成本仅 57%。TypeSafe 传以 $10B+ 估值融资 $1B+。
- Ramp 用重排任务以 3 倍更低成本、10 倍更低尾部延迟复现 Luna 精度;Jev 曾以不到 $1 证明 140 个 Software Foundations 定理。
Agent 基础设施
- LangChain 发布 Managed Deep Agents 0.8(记忆+访问策略、沙箱文件 API)、LangSmith 微调工具 smithtune CLI。
- Perplexity 开源 Rust 检索引擎 Photon:p99 从约 800ms 降至 65ms,机器减少 20%、单文档数据增 2.5 倍;Fast Search API p50 160ms,已成 Shopify 主搜索 API。
- Google Project Suncatcher:四颗 TPU 随卫星入轨,试验太空算力。
推理效率与研究:Liquid AI DSpark 投机解码在 M5 Max 达 3.13× 加速;GLM-5.3 在 8× MI355X 上跑出 469 tok/s;另有 Harness-Zero(将 agent harness 蒸馏进模型)、agent 失败模式与 RL 环境等研究。
「Infra」频道最新
- 开发者自建 AI 获客工作流,断言下时代入口属 OS 级硬件 — dotey · 2026-09-25
- WSJ:AI 关键内存芯片价格飙升令美国陷入两难 — pstAsiatech · 2026-09-25
- 实测:Qwen Flash Next IQ4_XS 四项基准全面胜过 27B FP8 — smallDeltaBigEffect · 2026-09-25
- 铌酸锂高速调制器新演示,双波段光栅耦合器设计更亮眼 — jwt0625 · 2026-09-25
- 推测解码走红:AI 推理进入「组合系统工程」时代 — Arindam_1729 · 2026-09-25
- 质疑 HBM 路线:堆 20 层后带宽摊薄至单层的 20% — knowrohit07 · 2026-09-25