Mercury Decide 实测:声明验证精度媲美前沿模型,成本为最低
StefanoErmon · x · 2026-10-09
评测机构 ValsAI 测试了 Inception 新发布的 Mercury Decide 模型,在与 TypeSafe Jev 相同的 benchmark 上,该模型在声明验证(claim verification)任务中达到前沿模型同等精度,且成本是迄今测过的所有模型中最低的。
「模型」频道最新
- 一周 16 万次:OpenAI 爬虫狂抓不存在的 URL,疑似新模型 RL 训练 — gaganghotra_ · 2026-10-09
- Anthropic 效率进步明显,但用户抱怨像被「保姆看管」 — kimmonismus · 2026-10-09
- LightOnOCR-3 发布:文档解析支持视觉定位与图表数据提取 — IgorCarron · 2026-10-09
- COLM 论文:后训练数据中的「岔路口」让推理模型覆盖变窄 — ParshinShojaee · 2026-10-09
- Google 医疗开源模型 MedGemma 论文登上 Nature Medicine — ymatias · 2026-10-09
- 研究员质疑:各家模型商条款是否允许用客户内容造合成数据 — RylanSchaeffer · 2026-10-09