蚂蚁开源百灵 Ling-3.0-flash-VL:视觉编程得分反超 GPT-5.4
智东西 · wechat · 2026-09-09
蚂蚁百灵正式开源首个原生多模态大模型 Ling-3.0-flash-VL:1240 亿总参数 MoE,单次推理激活 55 亿参数,原生支持图像/文本/视频输入,256K 上下文,BF16 和 FP8 权重已在 HuggingFace 和 ModelScope 开放,FP4/INT4 近期上线。
核心亮点:
- 视觉反馈机制:模型执行任务后会重新读取页面/环境状态再迭代修改——网页截图→生成代码→浏览器渲染→对比→继续改;同样适用于 GUI Agent 跨应用操作(找数据→Excel→图表)。
- 评测:Artificial Analysis 指数 42 分(比纯文本版高 4 分);Image-to-WebDevArena 匿名参测 1441 分,略高于 GPT-5.4 的 1440 分;OmniDocBench 91.35、WebVoyager 90.83。但整体仍落后 Claude Fable 5.1(66)等前沿闭源模型,MathVision、CharXiv 等部分测试低于 Qwen3.8-27B。
- 应用场景:体育比赛高光自动剪辑、灵光 App 实时视觉问答、多份医疗报告结构化提取与自查(强调不能替代医生)。
海外开发者已用 Flappy Bird 截图复刻出可玩的游戏页面。近一个月阿里千问 Qwen3.8-27B、DeepSeek-V4-Flash-Vision-Exp 相继开源,国产多模态开源节奏明显加快。
所属事件:蚂蚁开源 Ling-3.0-flash-VL 多模态模型(4 条相关)→
「编程与Agent」频道最新
- KVMem 把上下文溢出存为分页 KV 状态,Agent 成功率反超压缩方案 — omarsar0 · 2026-09-09
- 编程智能体是首个「自相竞争」的产品品类 — samgoodwin89 · 2026-09-09
- 单提示词跑通:本地 Qwen 27B 在 RTX 3090 上复刻马里奥 — ChopSticksPlease · 2026-09-09
- vibe coder 进阶指南:让模型画架构图、写 spec 并循环打磨 — Daniel_Farinax · 2026-09-09
- RSM 记忆方法:4k 预算达全上下文 83% 质量,token 成本仅 32% — dair_ai · 2026-09-09
- 腾讯混元发布 Gander:全双工多模态交互智能体技术报告 — Tencent-Hunyuan · 2026-09-09