INT21 称两周造 20 个推理引擎,MiMo 解码达 1308 tokens/s
bingxu_ · x · 2026-09-29
Bing Xu 转引 INT21 的推理基准并评论「人类手写 AI 软件将很快成为历史」。
- INT21 主张 agentic 时代推理延迟即业务延迟:编码 agent 执行一个修复需数十次串行模型调用,等待不断累积,因此把超快推理作为首选目标
- 两名工程师在两周内指导生成 20 个引擎,覆盖 7 类模型:自回归语言、扩散语言、语音识别、语音生成、OCR、图像与视频生成
- 对 15 个模型的子集与 SGLang、vLLM 对比:测试的 6 个文本模型解码速率全部领先,MiMo 达 1308 tokens/s,调优后的 SGLang 为 540,vLLM 为 1011
「编程与Agent」频道最新
- TinyFish 推学生赏金计划:单个 agent 应用最高奖 50 美元礼品卡 — testingcatalog · 2026-09-29
- Agent 可利用非确定性操作污染沙箱,令 trace 无法还原真实状态 — lbeurerkellner · 2026-09-29
- 十年前的博士答辩幻灯片依赖全挂,让 Claude 一把修好 — Ben_Reinhardt · 2026-09-29
- 开发者自嘲「随机产出率」:agent 编码时好时坏像抽卡 — carsonfarmer · 2026-09-29
- 作者开源 8 个 Godot 技能包,把 AI 做游戏踩坑经验变 Codex/Claude Code 工作流 — AIandDesign · 2026-09-29
- Cekura 语音模型实测:2214 通电话,Phonic 延迟最低 1.59 秒 — graceisford · 2026-09-29