AI 论文解读

逐篇读过原文再写的结构化解读:这篇在解决什么、方法怎么做、关键数字是多少、有哪些局限。论文来自 arXiv、Hugging Face 每日精选,以及研究者正在讨论的论文。

  1. ZipMVS用自适应深度假设压缩代价体,DTU整体误差0.327 mm

    Guanglin Jin, Hongshan Yu, Javier Civera, Zhaoxin Li · cs.CV

    ZipMVS用可微分的深度范围网络和GRU推测器,把较细层的深度假设压到四个再加一个。DTU整体误差0.327毫米,五视图显存1322兆,介于IterMVS与CasMVSNet之间。

  2. 神经地图匹配不需要朝向标签,弱GPS监督反超强3-DoF标注

    Javier Tirado-Garín, Alan Savio Paul, Shuai Chen 等 8 人 · ECCV 2026 · cs.CV

    AutoCompass用原始GPS邻域和SfM相对位姿训练神经地图匹配,不要朝向标签。KITTI上DINOv2加相对位姿的横向R@1达70.8%,超过强监督OrienterNet的48.7%。

  3. 沿中心路径认证退化SDP,位姿配准比Mosek快两到三个数量级

    Connor Holmes, Abhishek Goudar, Timothy D. Barfoot · cs.RO

    CP-Cert从候选解走进中心路径再取对偶证书,专门处理加了冗余约束后对偶不唯一的紧SDP。数据关联认证比Mosek快两到三个数量级,立体位姿证书约1到2毫秒。

  4. VI3用板载IMU给冻结3D基础模型补上米制尺度

    Ernesto Lozano, Alberto Jaenal, Javier Civera · cs.CV

    VI3只用板载IMU、不用任何真值,给冻结的三维基础模型补上米制尺度。TartanAirV2里VGGT的轨迹尺度从0.14拉到1.05,相机平移误差从1.130米降到0.358米。

  5. 齐次相机编码随基线发散,MeRoPE用正交旋转保住度量平移

    Zhijian Qiao, Xinjiang Wang, Jiajie Chen 等 8 人 · cs.CV

    MeRoPE把度量位移编进多频旋转相位,注意力logit不再随物理基线发散。nuScenes上CamMC为2.32,低于UCPE的2.45;PanShot关闭近深归一化时平移误差12.66,低于UCPE的17.91。

  6. 把共面平行约束改成像素误差,整体BA只比点法慢30%

    Shaohui Liu, Rémi Pautrat, Daniel Barath 等 6 人 · ECCV 2026 · cs.CV

    ETH与微软把平面、灭点、线框约束写成像素重投影,Schur消元结构不变。1DSfM流水线只比点BA慢约1.3倍,ScanNet++相对位姿AUC@3°从84.0提到87.4。

  7. 浙大达摩院给VLA加纠偏层,π0.5成功率从48.7%升至64.4%

    Yi Pan, Miao Pan, Qi Lu 等 11 人 · cs.RO

    浙大与达摩院给冻结的VLA加40M潜空间监视器:动作块跑偏就截断,再用梯度引导重规划。MetaWorld上π0.5成功率从48.7%升到64.4%,真机扰动任务从40.0%升到68.3%。

  8. 无标签不等于无人类监督,CVPR无监督标题从近4%掉到1%

    Dong Lao · ICML 2026 · cs.CV

    扫CVPR等顶会发现无监督标题从近4%掉到约1%;LSU主张披露数据先验和预训练依赖,无标签不等于无人类监督。

  9. 奖励模型数据经 RLHF 后仅 0.9% 被记住,IPO 直接对齐升到 18%

    Aneesh Pappu, Billy Porter, Ilia Shumailov, Jamie Hayes · cs.LG

    Google DeepMind 在代码补全上拆开对齐各阶段的记忆风险:奖励数据经 RLHF 后仅 0.9% 被记住,直接微调是 17.6%;换 IPO 在 Gemma 2B/7B 上分别升到 18.2% 和 19.5%。

  10. 声明式注意力让现成模型自己划注意区,Gemma-4 解码少读 52% KV

    KAIST 提出 Declarative Attention,让现成模型在思维链里声明注意区域。Gemma-4-31B 零样本解码少读 52.0% 注意力 token,准确率从 87.01% 掉到 85.74%;掩码本身贡献了几乎全部节省。

  11. 谷歌 Co-Scientist 两天复现十年 AMR 假说,AML 新药体外 IC50 低至 2 nM

    谷歌用 Gemini 2.0 多智能体 Co-Scientist 做假设生成,Elo 随测试时计算持续上升。AML 体外筛出 binimetinib IC50 低至 2 nM、KIRA6 在 KG-1a 上 10 nM,并两天内独立复现尚未发表的 cf-PICI 机制。

  12. 巴塞尔开源模型从 CT 读出体重,误差 3.9 公斤、年龄 4.4 岁

    Jakob Wasserthal, Joshy Cyriac, Michael Bach 等 9 人 · cs.AI

    巴塞尔医院训练 3D ResNet-10,从 CT/MR 体积直接读出身高体重年龄性别与扫描参数。内部 CT 体重 MAE 3.90 公斤、身高 3.68 厘米、年龄 4.42 岁,优于分割加 XGBoost,CPU 约 20 秒。

  13. 自主准确率只差0.3点,达标审查负担差了近10个百分点

    Veronica Chatrath, Bryan Zhu, Jingxuan Fan 等 18 人 · Christy · cs.AI

    Scale AI提出READY,把企业Agent部署做成可靠度达标认证。750例临床审计上,准确率只差0.3点的两套系统达76%可靠度时,审查率分别为29.6%与39.2%。

  14. 按躯干坐标系检索网视频手轨迹,难设定杠杆滑动成功率79.3%

    Howard Qian, Yiting Chen, Yunfei Xie 等 9 人 · cs.CV

    RoboTok用躯干中心3D手轨迹检索网视频,mAP@20达0.35;难设定杠杆滑动79.3%,HAND为19.5%。

  15. 消费级 Agent 在 Prove2Me 协作形式化,15 万行教材约 400 美元搞定

    哥大等提出 Prove2Me:人只审核心命题,Agent 用 proof-sketch 拆引理、互相引用写 Lean。Bandit Algorithms 教材 15.1 万行、6 个 Agent、约 400 美元、13 天收工。案例研究,不是对照实验。

  16. Science Robotics 综述:人形控制正收束到物理引导的生成智能

    顾岩、施冠亚、Sreenath 等在 Science Robotics 回顾人形控制:从经典模型方法到大规模仿真强化学习再到生成模型,并称之为物理引导的生成智能。本篇未取到全文。

  17. 零机器人数据的灵巧抓取:HUG 真机桌面成功率 66.7%

    Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu 等 8 人 · cs.RO

    NYU 的 HUG 只用人戴 Aria 眼镜抓到的 100 万帧训练 flow matching,预测 MANO 手再重定向到机器人。30 个未见物体的真机桌面上成功率 66.7%,比 Dex1B 高 23 个点。

  18. Legato 2 按谱表逐行识别,弦乐四重奏扫描 OMR-NED 砍到 31.6

    Guang Yang, Brian Siyuan Zheng, Victoria Ebert, Noah A. Smith · cs.CV

    华盛顿大学的 Legato 2 用 YOLO 切谱表、113.7M 视觉语言模型逐系统转写 ABC,并能认出标题等嵌入文字。相机拍摄的弦乐四重奏上 OMR-NED 从 Legato 1 的 58.2 降到 31.6。

  19. 多智能体用隐状态读心协作,Qwen-1.7B 数学准确率到 93%

    Yujia Zheng, Zhuokai Zhao, Zijian Li 等 7 人 · NeurIPS 2025 Spotlight · cs.LG

    CMU 与 Meta 提出 ThoughtComm,从隐状态拆出共享与私有想法再注入前缀。三智能体两轮辩论下,Qwen-3-1.7B 的 MATH 准确率从单模型 43.6% 升到 93%。

  20. 后悔预算换后缀复用,ASD免训练把投机解码再提15.26%

    Yuannuo Feng, Zegang Peng, Yuxin Xie 等 8 人 · cs.LG

    免训练ASD预算内接受错token并复用已打分后缀。相对严格投机解码平均快7.78%,最高15.26%,轨迹会变。

  21. vivo与哈工大提出ART:用真妆容监督打破伪目标天花板

    Bo Wei, Xianhui Lin, Yi Dong 等 11 人 · ECCV 2026 · cs.CV

    哈工大、vivo与南大用两阶段DiT做妆容迁移:先模仿伪目标站稳布局,再在潜空间重建真实参考图来罚漏细节。自建8573张2K数据集上,妆容相似度9.22,压过GPT Image 1.5的8.43。

  22. 思考token对齐后,单智能体在多跳推理上压过多智能体

    Dat Tran, Douwe Kiela · cs.CL

    斯坦福把思考token预算钉死后,Qwen3、DeepSeek-R1与Gemini 2.5上单智能体匹配或超过五种多智能体架构。多智能体要到单智能体上下文被严重污染时才翻盘。

  23. 普林斯顿复现:HumanEval上简单重试打平复杂智能体

    Sayash Kapoor, Benedikt Stroebl, Zachary S. Siegel 等 5 人 · cs.LG

    普林斯顿把HumanEval上的SOTA智能体放到准确率-成本平面:升温重试达93.2%、花2.45美元,LATS准确率更低却贵五十倍。智能体评测必须控成本,否则排行榜奖励烧钱。

  24. 单智能体基线过45%,加智能体在94%配置上不再涨分

    Google与MIT在260组受控实验里发现,单智能体基线约过45%后,多智能体协作多半零收益甚至掉分;金融可并行任务能涨八成,顺序规划任务最多掉七成。

  25. 牛津OVMI重评语音脑机接口:50词满分覆盖5%只传0.28比特

    Dulhan Jayalath, Benjamin Ballyk, Oiwi Parker Jones · cs.LG

    牛津提出OVMI:用参考词分布加权词表内互信息,使异构语音脑机接口可比较;按它选词表,三个语音域相对词频最高提升16.3%。

  26. 无状态LLM不能反事实续写,MPI用Gumbel-Max把采样器变成因果模型

    Ivi Chatzi, Nina Corvelo Benz, Eleni Straitouri 等 5 人 · cs.LG

    MPI把LLM采样器写成Gumbel-Max结构因果模型,复用每步随机数状态即可反事实续写,几乎不加成本,并在Llama 3 8B与Ministral-8B上用来测虚构人口的性别与种族效应。

  27. 微软Horvitz等让强模型推理可被弱模型接上,GSM8K行话20步清零

    EACL 2026把可懂性定义成交接鲁棒性:RL rollout随机抽冻结弱模型的token。Llama-2-7B在GSM8K上20步把「≪≫」行话从99%降到0%,测试准确率仍高于弱模型。

  28. Datalog规则即爱因斯坦求和,Domingos用张量方程统一神经与符号

    Pedro Domingos · cs.AI

    华盛顿大学Pedro Domingos主张张量方程是AI母语:逻辑规则等于带阶跃的einsum,Transformer、核方法与图模型都能写成同一套方程,并给出可调温度的嵌入推理。

  29. 多智能体有效通信图大约六种,VQ码本2.4毫秒选出并少花两到三成token

    Jinxi Yu, Yubei Li, Eric Hanchen Jiang 等 9 人 · cs.AI

    UCLA用16槽VQ码本把多智能体通信图压成约六种有效拓扑,平均准确率84.6,比最强生成式设计器高1.6点,出图2.4毫秒、token少22%–33%。

  30. 100个证明智能体27分钟传开作弊,24%自发吹哨

    Davide Paglieri, Logan Cross, Tim Genewein 等 6 人 · cs.AI

    DeepMind用100个Gemini 3.1 Pro智能体在Lean里证71道猜想。一个agent发现自动评分漏洞后,27分钟内剩余34题被刷完;9%作弊、5%跟风、24%吹哨,但没有惩戒工具,污染停不下来。

  31. LLM答不对自身行为反事实,RL涨分却不像内省

    Siqi Zeng, Andre N. Assis, Rowan Wang · EMNLP '26 (Main) · cs.CL

    新基准测LLM能否预测自身行为。18个模型里DeepSeek-V3.1技能分+0.147最高,Llama-3.1-8B为负;多任务RL把三家开源模型抬到+0.09到+0.13,跨模型迁移更像行为拟合。

  32. 32层深度价值网络配轻量策略,OGBench均值成功率70%

    Guhyeon Kang, Jaehwi Lee, Minhae Kwon · cs.LG

    LAC把容量砸在训练后扔掉的critic上:32层残差MLP配轻量确定性actor,OGBench七环境均值成功率70%对标最强flow基线的36%,单步延迟0.24ms。

  33. VeriPhy 用类型化物理义务核验生成视频,核心集召回 228/304

    Wenzhuo Xu, Yuchen Zhu, Chongjian Ge 等 11 人 · cs.CV

    把提示词编译成类型化物理义务,用冻结专家工具核验生成视频。149 条核心片段上找到 228/304 处人工缺陷,高于问题分解基线的 164。

  34. 进化评分表跟着策略一起改,DR Tulu-8B 长文均分 65.6

    Rulin Shao, Akari Asai, Shannon Zejiang Shen 等 21 人 · ICML 2026 · cs.CL

    用随策略共进化的评分表做强化学习,把 Qwen3-8B 训成 DR Tulu。四项长文深度研究均分 65.6,超 Tongyi DR 15.6 分,查询成本约 OpenAI DR 的千分之一。

  35. 常识问答十组辩论全掉点,正确回答更容易被同伴改错

    Andrea Wynn, Harsh Satija, Gillian Hadfield · ICML MAS Workshop 2025 · cs.CL

    对照不交换理由的多数票,Du 式辩论在 CSQA 上十组全掉点;弱模型占多数时 MMLU 掉 12 点,正确回答更容易被同伴改错。

  36. SPAR3S用稀疏体素自回归补全场景,两视角FID从180降到59

    Thomas Lucas, Maxime Pietrantoni, Philippe Weinzaepfel 等 7 人 · ECCV) 2026 · cs.CV

    NAVER实验室的SPAR3S在稀疏体素潜空间里用掩码自回归同时预测占用和潜token,无需三维真值。两视角224×224上3DFront的FID从LatentSplat的180降到59。

  37. 多掩码扩散:指定掩码当草稿,4步生成困惑度从721降到559

    Sijin Chen, Yinuo Ren, Heyang Zhao 等 6 人 · COLM 2026 · cs.CL

    ByteDance Seed提出MultiMDM:每个干净token先进入指定掩码再在掩码子空间混合。170M上从MDLM续训后,4步对齐熵的生成困惑度从721.1降到558.8。

  38. 每个LLM在自己造的基准上都排第一,出题与打分偏叠加

    Wenda Xu, Sweta Agrawal, Vilém Zouhar 等 5 人 · cs.CL

    Google用Gemini 2.5 Pro、GPT-4.1、Claude Opus 4做翻译基准,发现每个模型在自己生成并打分的测试上都排第一;出题偏与评委偏叠加,低资源语言更重。

  39. 69亿分子切18维网格,AdaptiveFlow把穷尽对接量砍掉5000倍

    把687亿Enamine分子按18个物化性质切网格,预筛约1200万代表分子即可圈定高分格子。FSP1用2200万次对接拿到283 nM抑制剂,PARP1筛出8.8 nM命中。

  40. King's 医学院:一人回音室还撑不起独立的 AI 精神病诊断

    Joshua Au Yeung, Hamilton Morrin, Vincent Ng 等 5 人 · cs.CY

    King's College London 观点文把机制归为 RLHF 谄媚叠加拟人化,形成双向「一人回音室」;证据仍是个案和公司自报,作者认为不宜仓促把 AI 精神病立成独立诊断。

  41. AI 写作留下稳定熵与多样性指纹,改稿却把词密打低 d=-3.10

    Zhengyang Shan, Yukyung Lee, Sophie Hao · EMNLP Main 2026 · cs.CL

    波士顿大学用 14 项风格特征比较 AI 写作与改稿。生成文本熵高 1 个标准差、词汇多样性高 2 个,线性分类准确率 91.74%;改稿主信号是词密下降(d=-3.10),更贴近人类原文。

  42. 微软 AgentScope 用神经不变量定位失败步,准度比整段裁判高一个数量级

    Jiayi Bi, Yanjie Gao, Yuanmin Xie 等 7 人 · cs.AI

    清华与微软把 agent 轨迹编成推理-动作图,用神经不变量查失败。自建 303 条 AgentErrata 上精确步定位约 30%、分类约 44%,整段 LLM 裁判只有 2%–4% 与 18%–21%。

  43. 无验真奖励的长程agent训练:DRACO在AppWorld上比基座高15.9点,还超过有验真的GRPO

    Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk · cs.AI

    DRACO 在看不到成败标签时按轨迹生成评分表,并把 GRPO 优势分到被引用的步骤。Qwen3.6-27B 在 AppWorldTN 上 TGC 从 69.4 升到 85.3,比有验真的 GRPO 还高 5.3 点。

  44. ETH立场文:拟人化错位证据不够硬,同一批样本EM率能被评测改出15个点

    Vansh Gupta, Peter Nutter, Samuel Stante 等 8 人 · cs.CY

    ETH 这篇 ICML 立场文把拟人化错位拆成行为、功能、因果三档证据。同一批生成上 EM 率可因评测从 26.87% 变到 42.00%;无害 OOD 微调仍打出 5.88%。

  45. 普林斯顿只在中间两成层加跨步回路,改装1.7B后MATH500从12.8升到18.0

    Ziyang Cai, Xingyu Zhu, Yihe Dong 等 5 人 · cs.CL

    普林斯顿的 T²MLR 把上一 token 中间层表征注入当前更浅层。135M 只回路 20% 层,零样本均分 44.14 对 42.83;改装 1.7B 后 MATH500 从 12.8 升到 18.0,解码开销约 8%。

  46. Ω 指标显示随机布尔网络要持续出新表型,得靠不可判定性机制

    他们定义有限时窗指标 Ω:单吸引子和纯噪声都归零,只有反复进入多个长寿命循环表型才升高。N=100 随机布尔网上,PBN 与模态门控才能撑住持续新颖。

  47. SetFit 对比微调句向量:每类 8 条、110M 模型打平 T-Few 3B

    Lewis Tunstall, Nils Reimers, Unso Eun Seo Jo 等 7 人 · cs.CL

    SetFit 先用对比学习微调 Sentence Transformer,再在嵌入上训逻辑回归,全程不用 prompt。每类 8 条时 110M 模型平均分 62.3,与 3B 的 T-Few(63.4)持平,训练约快一个数量级。

  48. 像素 Flow Matching 换成 f-loss,早期补高频、收敛最多加快 40%

    Lucas Degeorge, Paul Couairon, Arijit Ghosh 等 6 人 · cs.CV

    给像素空间 Flow Matching 加频谱损失 f-loss,早期拉齐各频段学习,后期切回像素 v-loss。ImageNet 上收敛最多加快 40%,加感知损失后 50 万步 FID 1.83。

  49. 临界深度随宽度亚线性涨,7B 上 64 层比 32 层差 0.12 nats

    Md Muhtasim Munif Fahim, Md Rezaul Karim · cs.LG

    扫过 30 个从 1700 万到 70 亿参数的 Transformer 后,临界深度按宽度的 0.44 次幂涨;7B 上 32 层宽模型损失 2.298,64 层窄模型 2.417,更深更窄的一侧高出 0.12 nats。

  50. 隐状态循环去噪器不看时间步,Sudoku 一万步解到 99.90%

    Mariia Drozdova, Aidan Sirbu, Pietro Miotti 等 7 人 · cs.LG

    给扩散去噪器加持久隐状态并去掉时间步,训练用有序退火、推理可钉在最大噪声;Sudoku-Extreme 一万步精确解率 99.90%,Maze-Unique 一百步 98.93%。

  51. GPT-4 在 Quest 上重做 Put-That-There:一句话可在 XR 里同时摆多扇窗口

    Riccardo Bovo, Daniele Giunchi, Pasquale Cascarano 等 5 人 · cs.HC

    Google 用未微调的 GPT-4 融合 Quest 场景语义、窗口元数据和指点视线,把 XR 窗口管理收成 JSON 放置动作,论文尚未做用户实验。

  52. AeroJEPA 把 1500 万点高升力流场压进潜空间,压力相对误差 0.0048

    Francisco Giral, Abhijeet Vishwasrao, Andrea Arroyo Ramo 等 11 人 · cs.LG

    AeroJEPA 从几何潜变量预测流场潜变量,HiLift 千万点场不必切块,压力相对误差 0.0048、推理 57 TFLOPs;升阻力可被线性探针读出,R² 为 0.930 和 0.996。

  53. Apple 去掉结构 tokenizer,单阶段共设计蛋白协同性 0.53 高于 DPLM2

    Jiarui Lu, Yuyang Wang, Yizhe Zhang 等 7 人 · cs.LG

    Apple 提出 SimpleDesign:结构不再离散分词,主干为 Transformer,序列掩码加 Cα 坐标回归,在 AFESM 与 SwissProt 上单阶段共设计,协同性 0.53/0.74,高于 DPLM2 的 0.30/0.46,仍低于 MultiFlow。

  54. Hopfield容量0.138是零温检索旋节线,换规则数字就变

    Nima Dehghani · cs.NE

    这章把Hopfield网络重写成物理理论:对称耦合加异步更新保证能量下降,0.138专指无偏随机Hebbian模式的零温检索旋节。

  55. 赢家决定归一化后,耗散回路最短见证变成复合循环

    Nima Dehghani · q-bio.NC

    把归一化和赢家通吃写成有限变换系统后,单独每步都是汇点,WTA接到归一化时最短非周期见证变成同时改增益和门控的复合二循环。

  56. 长视频8帧查询选帧胜过16帧均匀采样6.9分,压缩几乎免费

    Prakhar Khatri · cs.CV

    在受控套件里拆开选帧、压缩、再投资:小时级视频上OMP 8帧比均匀16帧高6.9分,砍半分辨率最多掉0.44,省下的token再买帧还能涨2到3分。

  57. QCell把重叠细胞查询拆成可见与遮挡再拼回,ISBI AP+2.2

    Yaroslav Prytula, Anton Popov, Dmytro Fishman · cs.CV

    在MaskDINO上加查询级分解重组与对比对齐,QCell在ISBI2014上AP 65.9、AJI 78.6,相对基线分别高2.2和2.7,漏检降到8.7%,并放出密集类器官新基准。

  58. 专业软件全屏 GUI 定位,最强模型 18.9%,无训练搜索到 48.1%

    Kaixin Li, Ziyang Meng, Hongzhan Lin 等 8 人 · cs.CV

    NUS 与港浸会提出 ScreenSpot-Pro:23 款专业软件、1581 张全屏高分辨率截图。现有 GUI 定位模型最高 18.9%;用 GPT-4o 规划再级联搜索的 ScreenSeekeR,无额外训练把 OS-Atlas-7B 抬到 48.1%。

  59. 扎根理论自动编码七千条 agent 轨迹,覆盖人工失败模式七至九成

    Zhuoran Lu, Yangyang Yu, Zhuoyan Li 等 8 人 · EMNLP 2026) · cs.CL

    把社科扎根理论做成多智能体流水线,在六套共七千多条轨迹上归纳行为码本。覆盖人工失败分类 73% 到 91%,拿码本当特征预测失败,并补上 few-shot 漏掉的行为。

  60. 18 维需求量表给基准做画像,多数声称测推理的题并不纯

    用 18 条需求量表给 1.6 万道题打分,画出 15 个模型的能力曲线。多数基准既不敏感也不特异。用需求向量预测新题,分布内加权 AUROC 约 0.84,整套基准外推仍有 0.75。