逐篇读过原文再写的结构化解读:这篇在解决什么、方法怎么做、关键数字是多少、有哪些局限。论文来自 arXiv、Hugging Face 每日精选,以及研究者正在讨论的论文。
Guanglin Jin, Hongshan Yu, Javier Civera, Zhaoxin Li · cs.CV
ZipMVS用可微分的深度范围网络和GRU推测器,把较细层的深度假设压到四个再加一个。DTU整体误差0.327毫米,五视图显存1322兆,介于IterMVS与CasMVSNet之间。
Javier Tirado-Garín, Alan Savio Paul, Shuai Chen 等 8 人 · ECCV 2026 · cs.CV
AutoCompass用原始GPS邻域和SfM相对位姿训练神经地图匹配,不要朝向标签。KITTI上DINOv2加相对位姿的横向R@1达70.8%,超过强监督OrienterNet的48.7%。
Connor Holmes, Abhishek Goudar, Timothy D. Barfoot · cs.RO
CP-Cert从候选解走进中心路径再取对偶证书,专门处理加了冗余约束后对偶不唯一的紧SDP。数据关联认证比Mosek快两到三个数量级,立体位姿证书约1到2毫秒。
Ernesto Lozano, Alberto Jaenal, Javier Civera · cs.CV
VI3只用板载IMU、不用任何真值,给冻结的三维基础模型补上米制尺度。TartanAirV2里VGGT的轨迹尺度从0.14拉到1.05,相机平移误差从1.130米降到0.358米。
Zhijian Qiao, Xinjiang Wang, Jiajie Chen 等 8 人 · cs.CV
MeRoPE把度量位移编进多频旋转相位,注意力logit不再随物理基线发散。nuScenes上CamMC为2.32,低于UCPE的2.45;PanShot关闭近深归一化时平移误差12.66,低于UCPE的17.91。
Shaohui Liu, Rémi Pautrat, Daniel Barath 等 6 人 · ECCV 2026 · cs.CV
ETH与微软把平面、灭点、线框约束写成像素重投影,Schur消元结构不变。1DSfM流水线只比点BA慢约1.3倍,ScanNet++相对位姿AUC@3°从84.0提到87.4。
Yi Pan, Miao Pan, Qi Lu 等 11 人 · cs.RO
浙大与达摩院给冻结的VLA加40M潜空间监视器:动作块跑偏就截断,再用梯度引导重规划。MetaWorld上π0.5成功率从48.7%升到64.4%,真机扰动任务从40.0%升到68.3%。
Dong Lao · ICML 2026 · cs.CV
扫CVPR等顶会发现无监督标题从近4%掉到约1%;LSU主张披露数据先验和预训练依赖,无标签不等于无人类监督。
Aneesh Pappu, Billy Porter, Ilia Shumailov, Jamie Hayes · cs.LG
Google DeepMind 在代码补全上拆开对齐各阶段的记忆风险:奖励数据经 RLHF 后仅 0.9% 被记住,直接微调是 17.6%;换 IPO 在 Gemma 2B/7B 上分别升到 18.2% 和 19.5%。
KAIST 提出 Declarative Attention,让现成模型在思维链里声明注意区域。Gemma-4-31B 零样本解码少读 52.0% 注意力 token,准确率从 87.01% 掉到 85.74%;掩码本身贡献了几乎全部节省。
谷歌用 Gemini 2.0 多智能体 Co-Scientist 做假设生成,Elo 随测试时计算持续上升。AML 体外筛出 binimetinib IC50 低至 2 nM、KIRA6 在 KG-1a 上 10 nM,并两天内独立复现尚未发表的 cf-PICI 机制。
Jakob Wasserthal, Joshy Cyriac, Michael Bach 等 9 人 · cs.AI
巴塞尔医院训练 3D ResNet-10,从 CT/MR 体积直接读出身高体重年龄性别与扫描参数。内部 CT 体重 MAE 3.90 公斤、身高 3.68 厘米、年龄 4.42 岁,优于分割加 XGBoost,CPU 约 20 秒。
Veronica Chatrath, Bryan Zhu, Jingxuan Fan 等 18 人 · Christy · cs.AI
Scale AI提出READY,把企业Agent部署做成可靠度达标认证。750例临床审计上,准确率只差0.3点的两套系统达76%可靠度时,审查率分别为29.6%与39.2%。
Howard Qian, Yiting Chen, Yunfei Xie 等 9 人 · cs.CV
RoboTok用躯干中心3D手轨迹检索网视频,mAP@20达0.35;难设定杠杆滑动79.3%,HAND为19.5%。
哥大等提出 Prove2Me:人只审核心命题,Agent 用 proof-sketch 拆引理、互相引用写 Lean。Bandit Algorithms 教材 15.1 万行、6 个 Agent、约 400 美元、13 天收工。案例研究,不是对照实验。
顾岩、施冠亚、Sreenath 等在 Science Robotics 回顾人形控制:从经典模型方法到大规模仿真强化学习再到生成模型,并称之为物理引导的生成智能。本篇未取到全文。
Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu 等 8 人 · cs.RO
NYU 的 HUG 只用人戴 Aria 眼镜抓到的 100 万帧训练 flow matching,预测 MANO 手再重定向到机器人。30 个未见物体的真机桌面上成功率 66.7%,比 Dex1B 高 23 个点。
Guang Yang, Brian Siyuan Zheng, Victoria Ebert, Noah A. Smith · cs.CV
华盛顿大学的 Legato 2 用 YOLO 切谱表、113.7M 视觉语言模型逐系统转写 ABC,并能认出标题等嵌入文字。相机拍摄的弦乐四重奏上 OMR-NED 从 Legato 1 的 58.2 降到 31.6。
Yujia Zheng, Zhuokai Zhao, Zijian Li 等 7 人 · NeurIPS 2025 Spotlight · cs.LG
CMU 与 Meta 提出 ThoughtComm,从隐状态拆出共享与私有想法再注入前缀。三智能体两轮辩论下,Qwen-3-1.7B 的 MATH 准确率从单模型 43.6% 升到 93%。
Yuannuo Feng, Zegang Peng, Yuxin Xie 等 8 人 · cs.LG
免训练ASD预算内接受错token并复用已打分后缀。相对严格投机解码平均快7.78%,最高15.26%,轨迹会变。
Bo Wei, Xianhui Lin, Yi Dong 等 11 人 · ECCV 2026 · cs.CV
哈工大、vivo与南大用两阶段DiT做妆容迁移:先模仿伪目标站稳布局,再在潜空间重建真实参考图来罚漏细节。自建8573张2K数据集上,妆容相似度9.22,压过GPT Image 1.5的8.43。
Dat Tran, Douwe Kiela · cs.CL
斯坦福把思考token预算钉死后,Qwen3、DeepSeek-R1与Gemini 2.5上单智能体匹配或超过五种多智能体架构。多智能体要到单智能体上下文被严重污染时才翻盘。
Sayash Kapoor, Benedikt Stroebl, Zachary S. Siegel 等 5 人 · cs.LG
普林斯顿把HumanEval上的SOTA智能体放到准确率-成本平面:升温重试达93.2%、花2.45美元,LATS准确率更低却贵五十倍。智能体评测必须控成本,否则排行榜奖励烧钱。
Google与MIT在260组受控实验里发现,单智能体基线约过45%后,多智能体协作多半零收益甚至掉分;金融可并行任务能涨八成,顺序规划任务最多掉七成。
Dulhan Jayalath, Benjamin Ballyk, Oiwi Parker Jones · cs.LG
牛津提出OVMI:用参考词分布加权词表内互信息,使异构语音脑机接口可比较;按它选词表,三个语音域相对词频最高提升16.3%。
Ivi Chatzi, Nina Corvelo Benz, Eleni Straitouri 等 5 人 · cs.LG
MPI把LLM采样器写成Gumbel-Max结构因果模型,复用每步随机数状态即可反事实续写,几乎不加成本,并在Llama 3 8B与Ministral-8B上用来测虚构人口的性别与种族效应。
EACL 2026把可懂性定义成交接鲁棒性:RL rollout随机抽冻结弱模型的token。Llama-2-7B在GSM8K上20步把「≪≫」行话从99%降到0%,测试准确率仍高于弱模型。
Pedro Domingos · cs.AI
华盛顿大学Pedro Domingos主张张量方程是AI母语:逻辑规则等于带阶跃的einsum,Transformer、核方法与图模型都能写成同一套方程,并给出可调温度的嵌入推理。
Jinxi Yu, Yubei Li, Eric Hanchen Jiang 等 9 人 · cs.AI
UCLA用16槽VQ码本把多智能体通信图压成约六种有效拓扑,平均准确率84.6,比最强生成式设计器高1.6点,出图2.4毫秒、token少22%–33%。
Davide Paglieri, Logan Cross, Tim Genewein 等 6 人 · cs.AI
DeepMind用100个Gemini 3.1 Pro智能体在Lean里证71道猜想。一个agent发现自动评分漏洞后,27分钟内剩余34题被刷完;9%作弊、5%跟风、24%吹哨,但没有惩戒工具,污染停不下来。
Siqi Zeng, Andre N. Assis, Rowan Wang · EMNLP '26 (Main) · cs.CL
新基准测LLM能否预测自身行为。18个模型里DeepSeek-V3.1技能分+0.147最高,Llama-3.1-8B为负;多任务RL把三家开源模型抬到+0.09到+0.13,跨模型迁移更像行为拟合。
Guhyeon Kang, Jaehwi Lee, Minhae Kwon · cs.LG
LAC把容量砸在训练后扔掉的critic上:32层残差MLP配轻量确定性actor,OGBench七环境均值成功率70%对标最强flow基线的36%,单步延迟0.24ms。
Wenzhuo Xu, Yuchen Zhu, Chongjian Ge 等 11 人 · cs.CV
把提示词编译成类型化物理义务,用冻结专家工具核验生成视频。149 条核心片段上找到 228/304 处人工缺陷,高于问题分解基线的 164。
Rulin Shao, Akari Asai, Shannon Zejiang Shen 等 21 人 · ICML 2026 · cs.CL
用随策略共进化的评分表做强化学习,把 Qwen3-8B 训成 DR Tulu。四项长文深度研究均分 65.6,超 Tongyi DR 15.6 分,查询成本约 OpenAI DR 的千分之一。
Andrea Wynn, Harsh Satija, Gillian Hadfield · ICML MAS Workshop 2025 · cs.CL
对照不交换理由的多数票,Du 式辩论在 CSQA 上十组全掉点;弱模型占多数时 MMLU 掉 12 点,正确回答更容易被同伴改错。
Thomas Lucas, Maxime Pietrantoni, Philippe Weinzaepfel 等 7 人 · ECCV) 2026 · cs.CV
NAVER实验室的SPAR3S在稀疏体素潜空间里用掩码自回归同时预测占用和潜token,无需三维真值。两视角224×224上3DFront的FID从LatentSplat的180降到59。
Sijin Chen, Yinuo Ren, Heyang Zhao 等 6 人 · COLM 2026 · cs.CL
ByteDance Seed提出MultiMDM:每个干净token先进入指定掩码再在掩码子空间混合。170M上从MDLM续训后,4步对齐熵的生成困惑度从721.1降到558.8。
Wenda Xu, Sweta Agrawal, Vilém Zouhar 等 5 人 · cs.CL
Google用Gemini 2.5 Pro、GPT-4.1、Claude Opus 4做翻译基准,发现每个模型在自己生成并打分的测试上都排第一;出题偏与评委偏叠加,低资源语言更重。
把687亿Enamine分子按18个物化性质切网格,预筛约1200万代表分子即可圈定高分格子。FSP1用2200万次对接拿到283 nM抑制剂,PARP1筛出8.8 nM命中。
Joshua Au Yeung, Hamilton Morrin, Vincent Ng 等 5 人 · cs.CY
King's College London 观点文把机制归为 RLHF 谄媚叠加拟人化,形成双向「一人回音室」;证据仍是个案和公司自报,作者认为不宜仓促把 AI 精神病立成独立诊断。
Zhengyang Shan, Yukyung Lee, Sophie Hao · EMNLP Main 2026 · cs.CL
波士顿大学用 14 项风格特征比较 AI 写作与改稿。生成文本熵高 1 个标准差、词汇多样性高 2 个,线性分类准确率 91.74%;改稿主信号是词密下降(d=-3.10),更贴近人类原文。
Jiayi Bi, Yanjie Gao, Yuanmin Xie 等 7 人 · cs.AI
清华与微软把 agent 轨迹编成推理-动作图,用神经不变量查失败。自建 303 条 AgentErrata 上精确步定位约 30%、分类约 44%,整段 LLM 裁判只有 2%–4% 与 18%–21%。
Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk · cs.AI
DRACO 在看不到成败标签时按轨迹生成评分表,并把 GRPO 优势分到被引用的步骤。Qwen3.6-27B 在 AppWorldTN 上 TGC 从 69.4 升到 85.3,比有验真的 GRPO 还高 5.3 点。
Vansh Gupta, Peter Nutter, Samuel Stante 等 8 人 · cs.CY
ETH 这篇 ICML 立场文把拟人化错位拆成行为、功能、因果三档证据。同一批生成上 EM 率可因评测从 26.87% 变到 42.00%;无害 OOD 微调仍打出 5.88%。
Ziyang Cai, Xingyu Zhu, Yihe Dong 等 5 人 · cs.CL
普林斯顿的 T²MLR 把上一 token 中间层表征注入当前更浅层。135M 只回路 20% 层,零样本均分 44.14 对 42.83;改装 1.7B 后 MATH500 从 12.8 升到 18.0,解码开销约 8%。
他们定义有限时窗指标 Ω:单吸引子和纯噪声都归零,只有反复进入多个长寿命循环表型才升高。N=100 随机布尔网上,PBN 与模态门控才能撑住持续新颖。
Lewis Tunstall, Nils Reimers, Unso Eun Seo Jo 等 7 人 · cs.CL
SetFit 先用对比学习微调 Sentence Transformer,再在嵌入上训逻辑回归,全程不用 prompt。每类 8 条时 110M 模型平均分 62.3,与 3B 的 T-Few(63.4)持平,训练约快一个数量级。
Lucas Degeorge, Paul Couairon, Arijit Ghosh 等 6 人 · cs.CV
给像素空间 Flow Matching 加频谱损失 f-loss,早期拉齐各频段学习,后期切回像素 v-loss。ImageNet 上收敛最多加快 40%,加感知损失后 50 万步 FID 1.83。
Md Muhtasim Munif Fahim, Md Rezaul Karim · cs.LG
扫过 30 个从 1700 万到 70 亿参数的 Transformer 后,临界深度按宽度的 0.44 次幂涨;7B 上 32 层宽模型损失 2.298,64 层窄模型 2.417,更深更窄的一侧高出 0.12 nats。
Mariia Drozdova, Aidan Sirbu, Pietro Miotti 等 7 人 · cs.LG
给扩散去噪器加持久隐状态并去掉时间步,训练用有序退火、推理可钉在最大噪声;Sudoku-Extreme 一万步精确解率 99.90%,Maze-Unique 一百步 98.93%。
Riccardo Bovo, Daniele Giunchi, Pasquale Cascarano 等 5 人 · cs.HC
Google 用未微调的 GPT-4 融合 Quest 场景语义、窗口元数据和指点视线,把 XR 窗口管理收成 JSON 放置动作,论文尚未做用户实验。
Francisco Giral, Abhijeet Vishwasrao, Andrea Arroyo Ramo 等 11 人 · cs.LG
AeroJEPA 从几何潜变量预测流场潜变量,HiLift 千万点场不必切块,压力相对误差 0.0048、推理 57 TFLOPs;升阻力可被线性探针读出,R² 为 0.930 和 0.996。
Jiarui Lu, Yuyang Wang, Yizhe Zhang 等 7 人 · cs.LG
Apple 提出 SimpleDesign:结构不再离散分词,主干为 Transformer,序列掩码加 Cα 坐标回归,在 AFESM 与 SwissProt 上单阶段共设计,协同性 0.53/0.74,高于 DPLM2 的 0.30/0.46,仍低于 MultiFlow。
Nima Dehghani · cs.NE
这章把Hopfield网络重写成物理理论:对称耦合加异步更新保证能量下降,0.138专指无偏随机Hebbian模式的零温检索旋节。
Nima Dehghani · q-bio.NC
把归一化和赢家通吃写成有限变换系统后,单独每步都是汇点,WTA接到归一化时最短非周期见证变成同时改增益和门控的复合二循环。
Prakhar Khatri · cs.CV
在受控套件里拆开选帧、压缩、再投资:小时级视频上OMP 8帧比均匀16帧高6.9分,砍半分辨率最多掉0.44,省下的token再买帧还能涨2到3分。
Yaroslav Prytula, Anton Popov, Dmytro Fishman · cs.CV
在MaskDINO上加查询级分解重组与对比对齐,QCell在ISBI2014上AP 65.9、AJI 78.6,相对基线分别高2.2和2.7,漏检降到8.7%,并放出密集类器官新基准。
Kaixin Li, Ziyang Meng, Hongzhan Lin 等 8 人 · cs.CV
NUS 与港浸会提出 ScreenSpot-Pro:23 款专业软件、1581 张全屏高分辨率截图。现有 GUI 定位模型最高 18.9%;用 GPT-4o 规划再级联搜索的 ScreenSeekeR,无额外训练把 OS-Atlas-7B 抬到 48.1%。
Zhuoran Lu, Yangyang Yu, Zhuoyan Li 等 8 人 · EMNLP 2026) · cs.CL
把社科扎根理论做成多智能体流水线,在六套共七千多条轨迹上归纳行为码本。覆盖人工失败分类 73% 到 91%,拿码本当特征预测失败,并补上 few-shot 漏掉的行为。
用 18 条需求量表给 1.6 万道题打分,画出 15 个模型的能力曲线。多数基准既不敏感也不特异。用需求向量预测新题,分布内加权 AUROC 约 0.84,整套基准外推仍有 0.75。