谷歌提出可提示视线估计新范式,支持文本与视觉提示
google · hf · 2026-08-14
谷歌在 Hugging Face 发布了 Gaze Target Estimation Anywhere with Concepts。
这是一种全新的可提示范式,将主体定位与视线估计集成于端到端的 Transformer 模型中。该模型无需多阶段处理流水线,可直接通过文本或视觉提示来识别目标主体并预测其视线落点。
「研究」频道最新
- 仅花 1000 美元从零训练,模型在 SWE-bench 达 11% 解决率 — sanmikoyejo · 2026-08-14
- AI重塑社会科学研究:耶鲁大学将于2027年举办相关学术会议 — yian_yin · 2026-08-14
- 开源 smol-muse:50M 参数版 Muse Glimmer 架构探索 — cneuralnetwork · 2026-08-14
- Epoch AI:每美元可购买的AI算力每年增长约49% — Jsevillamol · 2026-08-14
- MIT 推出 SciAgents:结合知识图谱与多智能体加速科学发现 — ProfBuehlerMIT · 2026-08-14
- 研究揭示 Agent 排行榜严重失真:特化排名掩盖真实泛化能力 — dair_ai · 2026-08-14