TypeSafe 发布决策模型 Jev:比前沿 LLM 快百倍、便宜两百倍
Latent Space · rss · 2026-09-16
本期 Latent Space AI News 覆盖三大技术故事:
- TypeSafe 的 Jev:主打「System One」决策模型,只做分类/路由/打分,不做文本生成。官方称比小型前沿 LLM 快 20–200 倍、便宜 40–400 倍,输出 token 免费,用 RLCD(校准决策)训练,号称「无幻觉」且校准良好。社区指出它不是通用语言模型,更像结构化选择的廉价推理引擎,可对接 DSPy 式 typed prediction,把昂贵的 LLM 调用编译成大量小型任务专用 AI 函数。
- Periodic Labs 的 Neon:实验室闭环 RL 的材料科学模型。用 1300 块 H200、数月专有实验数据、基于 Kimi K2.x 开源底座做 mid-training + RL,训练出 1T 参数的 XRD 分析专家模型,内部 FrontierXRD 评测从 2.7% 提到 55.3%,超过 GPT-6 Astra 和 Claude Fable 5.1 且推理成本更低。多位研究者认为这是「垂直专有数据 + RL 基建击败通用前沿模型」的模板,数据护城河公司将纷纷效仿,瓶颈将转向 RL rollout 吞吐和 verifier 算力。
- Gemini 3.8 Live:Google 发布 3.8 Live 与 3.8 Live Extended Thinking,支持 97 种语言、说话中异步调用工具,经 LiveKit/Pipecat/LangChain/Vercel 分发。Extended Thinking High 以 82.6 登顶 Artificial Analysis 语音转语音榜(超 GPT-Live-1 的 81.5),Tau Voice 68.6%;定价 $0.84/小时(标准)与 $3.50/小时(ET High),主打生产级实时语音 agent 部署。
其他动态:Devin 现可启动 Mac VM 并跨 macOS/Windows/Linux 成云 agent,底层计算机使用基建用 Rust 重写;LangChain 的托管 Deep Agent 全部变成 MCP server;微软论文显示纯 bash 在 TheAgentCompany 上比类型化工具目录高 21.8–24.5 分。
「模型」频道最新
- LLM 生成评分标准会被钻空子:新基准 ImpossibleRubrics 揭示 — Bowen Qin · 2026-09-16
- DeepSeek 不断上移二次方分量,被赞是「苦涩教训」式科学探索 — teortaxesTex · 2026-09-16
- 品牌想进 AI 回答?参数记忆与检索落地缺一不可 — dejanseo · 2026-09-16
- 用户吐槽 Claude 20 美元套餐额度骤降,十几条消息即触顶 — koltregaskes · 2026-09-16
- AI 一周:世界模型逼近物理世界,Devin 双模型协作反降 9% 成本 — TheTuringPost · 2026-09-16
- DeepSeek V4.1 Flash 被指遭评测社区冷落,ARC-AGI 与数学竞技场均缺席 — teortaxesTex · 2026-09-16