8k token 预算下,120B 蒸馏模型金融推理超 Kimi
ycombinator · x · 2026-07-31
针对 Semafor 报道的关于“从中国模型蒸馏而来的美国模型国籍归属”问题,Cyril Gorlla 分享了其实测数据。在生产系统实际运行的 8k token 预算下,他们的 120B 参数模型在 FinanceReasoning 基准上得分 83.61%,超越了 Kimi K3(81.93%)和 Inkling(65.13%)。该模型在单张 H100 上运行,查询成本比大模型低 62 到 160 倍。不过,如果预算不受限制,大型原始模型在绝对准确率上依然胜出。
「模型」频道最新
- 仅用 "---" 符号即可让大模型角色错乱 — davidad · 2026-07-31
- 横评:GPT-5.6 Luna比Gemini 3.6 Flash更便宜且聪明 — Angaisb_ · 2026-07-31
- 大模型推理成本骤降:4个月Token价格缩水至十三分之一 — charliermarsh · 2026-07-31
- vLLM 发布 Inkling-Small 部署指南:最低180GB显存可跑 — vllm_project · 2026-07-31
- OpenAI 回应基准测试质疑:GDPval 趋于饱和 — emollick · 2026-07-31
- Text Arena 最新榜单:Anthropic 系列霸榜前七 — arena · 2026-07-31