Ling 3.1 Flash 补充成绩:Terminal-Bench 0%→33%,幻觉率降至 38%
ArtificialAnlys · x · 2026-10-06
Artificial Analysis 对 Ling 3.1 Flash 的补充数据:Terminal-Bench v4.0 从上代的 0% 升至 33%,AutomationBench-AA 从 3% 升至 62%;AA-Omniscience 得分 +2,准确率 29%,幻觉率 38%。
所属事件:蚂蚁 Ling 3.1 Flash 发布,智能指数翻倍至 41 分(4 条相关)→
「模型」频道最新
- Mistral Large 4 预览持续变强,RL 训练仍在跑,本月内开放 — qtnx_ · 2026-10-06
- 一张图半美分:博主一美元出头批量生成 200 多张图试风格 — Angaisb_ · 2026-10-06
- Mistral ML4 人评:STEM、CAD、金融超 GLM 5.3,智能体编码持平 — GuillaumeLample · 2026-10-06
- Mistral ML4 广度评测达开源 SOTA,安全任务漏洞修复得分 82% — GuillaumeLample · 2026-10-06
- ML4 用 3800 块 Grace Blackwell 训练,Mistral 两轮新集群在路上 — GuillaumeLample · 2026-10-06
- 网友观察:同模型同努力档位下,Codex 似乎比 ChatGPT 更聪明 — mark_k · 2026-10-06