蚂蚁开源金融模型 Ling-3.0-flash-Fin 评测:知识与幻觉均逊于 VL 版
ArtificialAnlys · x · 2026-09-16
Artificial Analysis 发布对蚂蚁集团新开源金融模型 Ling-3.0-flash-Fin 的评测线程,该模型基于 Ling-3.0-flash 构建,与金融机构合作开发。
关键数据:
- Intelligence Index 得分 23,Finance & Accounting Index 得分 24,与 VL 版持平;凭借每 token 仅 5.1B 激活参数(总参数 124B)位于智能-激活参数 Pareto 前沿。
- AA-Briefcase(复杂商业工作流,产出表格/PPT/备忘录)967 Elo,略低于 VL 版 986;rubric 通过率 23.5% vs 24.9%,分析质量 866 vs 907,但演示质量 1095 vs 1076 反而更高——尽管它没有图像输入能力。
- GDPval-AA v2(专业知识工作)1171,落后 VL 版约 50 分,但高于 MiniMax-M2.7 的 1087。
- 商业知识准确率更高(17% vs 11%),但幻觉也更严重(非幻觉率 67% vs 81%),且每任务平均输出约 6.7 万 token,比 VL 多 34%。
- 对比之下,Qwen3.8 27B (xhigh) 以 27B 总参数得分 34,两款 Ling 模型都在总参数前沿之下。
所属事件:蚂蚁开源金融模型 Ling-3.0-flash-Fin 评测出炉(3 条相关)→
「创投」频道最新
- Agent 跨厂商调用 API,如何在一家处设支出上限? — apyhubnico · 2026-09-16
- BackOps AI 融资4200万美元B轮,用Agent自动化物流与供应链运营 — HankYeomans · 2026-09-16
- Typeless 免费额度从每周 8K 砍到 2K,用户吐槽被背刺 — xiaohu · 2026-09-16
- Cohere 与 Aleph Alpha 合并,成为横跨欧美的大模型开发商 — cohere · 2026-09-16
- 开发者把月入 $87k 的生意做成游戏:真实营收驱动城市成长 — eptwts · 2026-09-16
- OpenAI 官宣扩展 ChatGPT 广告,推出赞助式 Agents — vertigoruntime · 2026-09-16