开源 5.3B 决策模型 Aplomb 1:1M 上下文多模态,4B 级榜首
empiriolabsai · reddit · 2026-10-07
EmpirioLabs 发布开源权重决策模型 Aplomb 1(5.3B,基于 Qwen3.5-4B + Qwen3-Omni 音频编码器):
- 能力:单请求读入最多 1M token 的文本/JSON/图像/视频/音频,返回工具选择与每个枚举/布尔参数的概率(如 issuerefund 0.969),让 agent 高置信自动执行、低置信上交大模型;还能输出「输入不含答案」的概率。
- 成绩:Decision Index 0.2.1 得 44.86,4B 级第一;38 项 benchmark 中 8 项为 ≤5.3B 模型最高,含 MMLU-Pro、GPQA Diamond、BBH;JevBench Hard 77.5%,MASSIVE 51 语种零样本意图平均 75%。
- 速度与价格:自研推理运行时把 1M token 全文决策从约 111 秒压到约 3 秒(525 项长上下文测试全对);API 输入 $0.02/1M token,输出免费,默认 ZDR,兼容 OpenAI/Anthropic/Gemini 格式;短问题模型耗时约 15ms。
- 许可:bf16 下约 12GB 显存可跑;许可证对研究/评估/个人及年收入低于 $1M 的公司内部使用免费。需注意训练数据包含了 38 项 benchmark 中 WinoGrande 与 ContractNLI 的公开训练集。
所属事件:EmpirioLabs 开源 5.3B 决策模型 Aplomb 1,支持 1M 上下文多模态(2 条相关)→
「模型」频道最新
- 一句锐评:Meta Muse 表现不佳 — HanchungLee · 2026-10-07
- Claude 写 Maxscript 时主动询问「要不要切换到 Work 模式」,网友直呼新鲜 — Efistoffeles · 2026-10-07
- 博主自建盲测:pplx-decider-1.1 与前沿模型一致率达 95.6% — bo_wangbo · 2026-10-07
- Google 开源 EmbeddingGemma 2:740M 参数跑赢两倍大对手 — The Decoder · 2026-10-07
- Mistral Large 4 发布,CEO 称网络攻击能力「超越中国模型」 — BLUECOW009 · 2026-10-07
- 女子对 Claude 发威胁言论被人工审核上报,遭重罪起诉 — XFreeze · 2026-10-07