Opus 5.5 领跑 SimpleBench,代码模型变身解释视频引擎
Latent Space · rss · 2026-09-29
Latent Space AINews(9/24–9/25)要点:
前沿模型混战
- Claude Opus 5.5:SimpleBench 88.4% 居首;Terminal-Bench-Science 上推理强度 low→xhigh 从 24% 升到 62%,max 反降到 59%(@theo 建议避开 max);被评 Anthropic 史上最佳视觉模型,成本比 Fable 5.1 低约 60%。不少用户认为 $200 Claude Code 套餐已胜过 Codex。
- GPT-6 家族:Astra 据报第三次尝试通关 NetHack;Luna [Max] 进 Code Arena WebDev 第 24 名;DOOM 对战 Astra 胜率 82.5%。
- Gemini 3.8 Flash:AA 指数 41、291 tok/s、1M 上下文,Cline 免费;ARC-AGI v2 89.2%、v1 98.5%。
- 小米 MiMo-V2.6-Pro:MIT 开源、全模态、1M 上下文,AA 指数 46 仅次于 GPT-5.6 Sol,成本 $0.13 vs $1.99,并开源 RL 代码与环境(但其 RL 增益难以泛化到更难数学评测)。另:Grok 4.7 登 Agent Arena 第 16。
「System One」决策模型
- TypeSafe 拟以 100 亿+ 估值融资 10 亿+;其 Jev 用 RL 训练返回带概率的类型化决策:每千次判定 $0.044、152ms,比 GPT-6 便宜约 277×,RewardBench/HaluEval 差距 3 分内;级联 GPT-6 Astra 保 99% 精度、57% 成本。曾以不到 $1 证明 140 条 Software Foundations 定理(便宜约 130×)。CLM、GLiNER2.5-Decide、Tev1 0.8B 等替代方案涌现。
Agent 基础设施
- LangChain Interrupt:Managed Deep Agents 0.8(记忆+访问策略、沙盒文件 API)、LangSmith 微调链路。
- Perplexity Photon:Rust 检索引擎,p99 从 800ms 降到 65ms,机器少 20%、单文档数据多 2.5×;Fast Search API 160ms p50、单任务成本降 68%,Shopify 已作为主搜索 API。
- Weaviate 1.39 MMR 查询时多样性 GA;Quail 单 H100 达 1B+ 输入 token/分钟的 AI-SQL。
推理加速
- Liquid AI DSpark 推测解码:LFM2.5-VL-3B 在 M5 Max 上提速 3.13×;GLM-5.3 在 8× MI355X 上单用户解码 469 tok/s;Pruna few-step LoRA 令 Qwen-Image-2.1 快 6.3×;谷歌把 4 颗 TPU 送上太空(Project Suncatcher)。
研究
- Harness-Zero:把 agent harness 蒸馏进模型,无 harness 部署成功率 23.3%→44.3%,超过带 harness 的基座模型(41.7%)。
- XYEval:一条误导性用户提示使分数相对下降最高 46.7%,agent 推理中明知不对却仍照做。
- NeurIPS 论文:抑制单个 MLP 神经元即可绕过 7 个模型(1.7B–70B)的安全拒绝。
- Meta 用专用记忆 agent 对抗上下文腐化,Sonnet 4.5 从 37.6%→45.9%;Sakana 聘 Schmidhuber 任 RSI Lab 首席科学顾问。
世界模型与代码媒体:Odyssey Agora-2 实时模拟 20 个智能体共享环境;Meta Muse Realtime Avatar 约 870ms 延迟;Opus 5.5/Astra 纯用代码生成视频动画,引发「谁说必须用扩散模型」讨论。
「Infra」频道最新
- Brookings 论文预测 AI 基建投资达 10.3 万亿美元,融资风险被掩盖 — VraserX · 2026-09-29
- SemiAnalysis 拆解 GLM-5.3:稀疏注意力为何没能省下 HBM 内存 — burny_tech · 2026-09-29
- 蒙特利尔 Exploit Summit 亮点:Bittensor 生态大版图一览 — markjeffrey · 2026-09-29
- Bain 测算:AI 到 2031 年需年入 6 万亿美元才能撑住算力建设 — sanjaykalra · 2026-09-29
- 实测打脸:DGX Spark 上 bf16 反而比 int8 convrot 更快,H3 视频生成差 14 秒 — dtdisapointingresult · 2026-09-29
- BAAI CoWA 注意力架构:全因果覆盖改为集体属性,训练延迟降 7.4 倍 — BAAI · 2026-09-29