TypeSafe 首周 ARR 破亿美元,决策模型三天成新品类
Latent Space · rss · 2026-10-10
头条:TypeSafe/Jev 现象
- TypeSafe 宣布 "Series AI" 融资,红杉透露上线首周即突破 1 亿美元 ARR,估值达 75 亿美元(上线仅 3 周)。
- Jev 引爆 "决策模型"(decision models)新品类:单次前向传播返回带类型答案(概率、选项、分数),各家同日跟进。
决策模型新品类
- OpenAI Decisions API:三种请求类型(条件为真的概率、从列表挑选、按等级打分),跑在 GPT-6 Luna 上,输入 $0.10/M tokens、无输出计费,官方称快达 10 倍。
- Microsoft Decision-1:定位 LLM judge 与科学假设筛选,早期评测指一致性与复杂决策仍是短板。
- Perplexity pplx-decider-v1.1-27b:Decision Bench 1071 例准确率 94.5%,$0.017/千次决策。
- Cloudflare clef-omni:支持音视频图文,clef-flash 比 Jev 便宜、整体快约 2 倍,权重已开源。
- Liquid d1 上架 Vercel AI Gateway,支持视觉分类/路由/打分;vLLM Semantic Router 与 LangSmith 均接入 typed answer 范式。
- 自己训练:Unsloth 免费笔记本把 Qwen3.5-4B 变成决策模型(8GB 显存);Qwen3.5-0.8B 实测 60 步准确率 37%→65%,4GB 卡约 10 分钟。
- 为何 agent 需要:大量 agent 步骤是是非题而非生成;LangChain 称按任务路由到最便宜够用模型,Open SWE 中位成本降 64%。
- 相关研究:Apple/CMU 的 SSR 用长度归一化似然在共享 KV cache 的一次批处理中为六种策略打分,每轮推理延迟降 90%+,端到端延迟仅降 28–54%。
多智能体与编码工具
- Claude Managed Agents 公测:主 agent 写分阶段计划,单次可派发最多 1000 个子 agent 再合并结果;Anthropic 提醒 token 消耗可能很高。
- Claude Code Projects 全量开放候补用户,任务并行线程化,会话支持本地运行;Opus 5.5 fast mode 上线但按用量计费、不含在订阅内。
- Vals AI 实测:GPT-6 Sol 与 Opus 5.5 组队成本升 1.8–5.1 倍,仅 Sol 中等力度显著提升 7.3 分;Opus 走串行波次,最大力度下每 app 约 6.8 个子 agent、约 1140 次子 agent 工具调用,无显著收益。
- Prime Agent 用 Rust 重写自己:2000+ agent 集群、1 万+ 沙箱、2000 亿+ GLM-5.3 tokens,可用输入速度提升 13 倍、启动内存省 83%。
- Codex:Windows 沙箱基于 Microsoft Execution Containers;Pro 版新增 Composer 下一条消息预测(有用户不满 Pro-only 限制);DHH 称 GPT-6.1 Sol 让 Codex 取代 Claude 成主力。
- Devin:可派生 Devin 树,总耗时取决于最慢分支而非求和;还接受个人 ChatGPT plan。
模型发布与评测
- Qwen-Image-2.1-Turbo(开源权重):7B 加速版,8 步 2K 生成 + 自然语言编辑。
- StepFun Step 5 Preview:600B 总参/27B 激活稀疏 MoE,1M 上下文带视觉,Hermes Index 33.89 追平 GPT-6 Luna,OpenRouter 热度第一,10 月 15 日开源权重。
- Upstage Solar Mini 4:35B MoE/3B 激活,524K 上下文、208 tok/s,AAII 24 分为 3B 激活最佳,Cline 内免费。
- Gemini 4 Argon:DeepSWE v1.1 报 77.9%(Opus 5.5 为 74.2%),首批面向 650+ Fairwind 防御者,定价 $2/$10 每 M tokens;另有未经证实的内部 "Carbon" checkpoint 接近 Opus 5.5 编码水平的传闻。
- 语音:HeyGen Voice 以 Elo 1201 居 TTS arena 第一;16.9MB 端侧 STT 模型 Whistle 号称对标 Whisper base。
- 多轮图像编辑:连续 30 次编辑实测,Ideogram 4.5 与 FLUX 3 局部编辑保真 95%+。
「编程与Agent」频道最新
- Vibe coding 承诺落空:模型迭代快到没人敢认真做产品 — sull · 2026-10-10
- Vibe42:手机远程指挥家里电脑跑 Claude Code 的零配置终端 — yihui_indie · 2026-10-10
- 用代码做 AI 视频被低估:513 个爆款案例与 Prompt 全开源 — yihui_indie · 2026-10-10
- Google DeepMind 招 AI 编码评测工程师,年薪最高 110 万美元 — brianryhuang · 2026-10-10
- 开发者手搓「ML 团队」Agent 集群:自动完成特征工程到上线的全流程 — kmeanskaran · 2026-10-10
- 开源 MCP for Blender 获 2.6 万星,附 Opus 驱动 Blender 实战技巧 — sidahuj · 2026-10-10