蚂蚁开源 Ling-3.0-flash-VL:看得懂还会用工具的视觉模型
FellMentKE · x · 2026-09-09
蚂蚁 AntLingAGI 开源视觉语言模型 Ling-3.0-flash-VL(BF16 与 FP8 权重,FP4/INT4 待发)。
- 能力不止识别:理解图像、视频、文档与 UI
- 可依据视觉线索推理、搜索、验证
- 具备工具调用、结果核查与任务交付的 agentic 能力
- 实机演示:手机摄像头即可识别物体、朗读场景描述、翻译外文路牌,适用于旅行与视觉无障碍场景
- 评论者指出其把视觉编辑变成无代码工作流的潜力。
所属事件:蚂蚁开源视觉语言模型 Ling-3.0-flash-VL(2 条相关)→
「多模态」频道最新
- geoface:用按地理元数据生成的人脸玩「猜你在哪」游戏 — hamostaf04 · 2026-09-09
- Wan 2.2 Fun Control 实测:用控制模式做视频上色 — GdaTyler · 2026-09-09
- 用几条 Prompt 生成视频:开发者开源 HTML/CSS 视频模板库 — round · 2026-09-09
- 几条提示词搞定:用 GPT-Image 2.5 把草图变成动画 GIF — iamrobotbear · 2026-09-09
- Blender 插件 TURNtable Viewer 1.4.3:360° 转台图一键变伪 3D 广告牌 — o0ANARKY0o · 2026-09-09
- 求助帖:ComfyUI 换装不丢角色长相与姿势的工作流怎么搭 — Any-Security4098 · 2026-09-09