谷歌提出可提示视线估计新范式,支持文本与视觉提示

google · hf · 2026-08-14

谷歌在 Hugging Face 发布了 Gaze Target Estimation Anywhere with Concepts。

这是一种全新的可提示范式,将主体定位与视线估计集成于端到端的 Transformer 模型中。该模型无需多阶段处理流水线,可直接通过文本或视觉提示来识别目标主体并预测其视线落点。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →