Apple 提出多视图注意力 RayRoPE
Apple ML Research · rss · 2026-07-20
RayRoPE:多视图注意力的投影射线位置编码
Apple ML Research 研究了用于多视图 Transformer 的位置编码问题。该方法处理的是一组带位姿的输入图像,论文指出,现有的绝对或相对位置编码很难同时满足三项目标:既要能唯一标识 patch,又要支持带有多频相似性的 SE(3) 不变注意力,还要能根据场景几何自适应变化。
为解决这个缺口,作者提出 RayRoPE。它基于每个 patch 对应的射线来表示位置,但不只使用射线方向,而是进一步利用射线上的一个预测点参与编码。这样做的目标,是让编码更贴合真实场景几何,同时保留注意力机制所需的几何不变性。
「研究」频道最新
- OpenAI 认为长程模型要按完整行动序列做安全对齐检查 — rhiever · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 图计算工作负载 854.graph500 进入 SPEC CPU 2026 — Prof_DavidBader · 2026-07-22
- BlackboxNLP 2026 因投稿激增招募额外审稿人 — hanjie_chen · 2026-07-22
- AWS 证明自蒸馏推理可在 SFT 中保住推理能力 — AWS ML Blog · 2026-07-22
- UI2App 显示截图还原远落后于真实交互恢复 — Grace Man Chen · 2026-07-22