VLM能否内化工具调用?「用图像思考」研究登陆COLM
PMinervini · x · 2026-10-07
一项将在 COLM 会议展示的研究探讨:视觉语言模型(VLM)借助工具调用可以实现「用图像思考」,但模型能否在潜空间(latent space)中直接内化调用正确工具的效果,从而在推理时无需显式调用工具?
作者 Ashutosh 在 COLM 上做报告,推文附有详细线程,属于 VLM 推理机制方向的新方法研究。
「研究」频道最新
- Looped Transformer 概念回潮,研究者指其源自 2016 年老论文 — natanielruizg · 2026-10-07
- 实验表明语言模型不用可训练输入嵌入表也能学会语言 — A. Bochkov · 2026-10-07
- EmbeddingGemma 2 实测:740M 参数打通图文音视频统一向量检索 — Prompt Engineering · 2026-10-07
- DOE 与 NIH 携手 DeepMind、Meta 等,共建 AI 细胞通用预测模型 — snikolov · 2026-10-07
- 双臂移动版 UMI 打通,作者称「后脑插线赛博感十足」 — neurosp1ke · 2026-10-07
- 研究者携 Meta-Harness 与 Combee 两论文亮相 COLM 2026 并求业界职位 — Kangwook_Lee · 2026-10-07