AI 论文解读

逐篇读过原文再写的结构化解读:这篇在解决什么、方法怎么做、关键数字是多少、有哪些局限。论文来自 arXiv、Hugging Face 每日精选,以及研究者正在讨论的论文。

  1. 不标失败数据,3 层 MLP 定位 agent 出错步骤,胜过 GPT-5 还快五千倍

    Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li · cs.AI

    只用 100 条成功轨迹训练单类 Neural CDE,按逐步异常分定位 agent 失败步骤,域内 F1 比 GPT-5 提示基线高 20 个点,推理零 token、快 200–5000 倍。

  2. 无引导粗采样下状态落后于模型时间,滞后选增益让 FID 从 28.0 降到 12.2

    Youssef Saied, François Fleuret · cs.CV

    在采样时把 Flow Matching 的速度乘上按群体时间滞后标定的常数增益,无需重训,无引导 SiT-XL/2 于 ImageNet-256、NFE 25 的 FID 从 28.0 降到 12.2,扫网格最低到 8.7。

  3. 两轮 MASS 后单位 token 得分 1.2-1.6 倍

    Hyunin Lee, Jinglue Xu, Jeffrey Seely 等 7 人 · cs.AI

    两轮 MASS 后 Qwen3.6-27B 在四项研究基准上单位 token 得分达 1.2-1.6 倍。

  4. 把机器人当图灵机:纯代码策略拿下 RoboDojo 70.24%,超 SOTA 38.9 个点

    Kairui Hu, Siyuan Hu, Fangzhou Hong 等 5 人 · cs.RO

    把机器人策略全部写成代码,自己测状态、自己记状态,测试时不跑任何模型,在 RoboDojo 42 个双手任务上拿到 70.24% 成功率,比此前最佳高 38.9 个百分点。

  5. 从随机代码起步,自学习循环 190 轮解出 7.8 万条 OEIS 数列

    Thibault Gauthier, Miroslav Olšák, Josef Urban · cs.AI

    NMT 把数列翻译成程序,验证后回流训练;从随机代码起步,190 轮解出 78,118 条 OEIS 数列,累计 84,587 条。

  6. 华为:百万处理器仍是一台计算机,靠嵌套 BSP 与统一总线

    Heng Liao · cs.DC

    华为把 BSP 递归嵌套、与逐层嵌套的硬件对齐,一个 SuperNode 装下 8000+ 节点、全机 barrier 低于 10 微秒

  7. 五大市场统一回测 5000 个 AI 因子:四种挖掘范式无一占优

    Zhuohan Wang, Carmine Ventre · q-fin.PM

    五大股市统一评测约 5000 个 AI 挖掘因子,GP、RL、生成式、LLM agent 四种范式无一持续占优,2016 年手写的 Alpha101 在组合层仍有竞争力。

  8. 95 小时视频流预训练,StreamMAE 追平 i.i.d. 训练

    Ivan Martinović, Lukas Knobel, Yuki M. Asano · NeurIPS 2026 · cs.CV

    连续视频流按序预训练,StreamMAE 只改数据管线就追平同数据 i.i.d. MAE,流从 12 小时扩到 95 小时持续涨点。

  9. 74.8%的错猜是苹果:开源模型检出注入,却读不出内容

    Harvey Lederman, Kyle Mahowald · cs.AI

    在当时最大的Qwen和Llama上,模型能察觉想法被注入,注入的内容却经常对不上:检出峰值53.9%与31.7%,正确指认最多13.9%,错猜里74.8%答成苹果。

  10. LLM教师九成插手,进度18%就开口,换题迁移近乎为零

    Verona Teo, Raghav Jain, Tobias Gerstenberg, Max Kleiman-Weiner · cs.LG

    四款LLM盯着Qwen2.5-7B解题:干预率90%、进度18%就出手,即时净增0.20,换同类题几乎不涨。

  11. 6840道合成题里Agent近满分,理解加码后准确率才掉

    Nishant Balepur, Kiran Tomlinson, Tobias Schnabel · cs.SE

    CABRA从调用图造出6840道受控编程题。八个裸模型随规模掉点,六个Agent靠grep和脚本维持近满分。任务改成跨类抽取共享逻辑后,Agent准确率才随行数下降。

  12. SanSi:1.4B 模型循环 8 次作答,只比 4B 单次模型低 1.8 点

    Shuyu Gan, Young-Jun Lee, Dongyeop Kang · cs.CL

    把循环预训练的 1.4B 模型改成类型化决策模型,10,027 条测试 72.0%,比同形单次模型高 13.5 点

  13. LLM按残缺网格写程序,关节资产真机策略掉点不超过10

    Chuanrui Zhang, Zaijia Yang, Duomin Wang 等 7 人 · cs.RO

    预训练模型不微调,把残缺网格写成可仿真关节资产,部件F1达到84.8%,真机三项任务掉点最多10。

  14. 在图上画圈写字就能改图,VibeEdit 用画布指令替代文字提示

    Jinjing Zhao, Fangyun Wei, Yitong Wang 等 12 人 · cs.CV

    VibeEdit 把画在图上的圈选、箭头加手写短注当完整编辑指令,419 例评测 VLM 评分 79.9,比最强文字基线高 12.5 分。

  15. Sakana 与 MIT 用 CLIP 自动搜索人工生命,找到开放性超 Conway 的规则

    Akarsh Kumar, Chris Lu, Louis Kirsch 等 7 人 · cs.AI

    ASAL 用 CLIP 给仿真画面打分,把找人工生命变成自动搜索,在 Lenia、Boids 等五种基底上发现新生命形态,以及开放性超过 Conway 生命游戏的规则。

  16. SparseEngine 统一 15 种稀疏注意力方法,解码吞吐最高 10 倍于 vLLM

    Jitai Hao, Quansheng Gu, Qiang Huang, Jun Yu · cs.LG

    用统一生命周期契约把 15 种稀疏注意力方法装进同一推理引擎,KV 驱逐下大 batch 解码吞吐约 10 倍于 vLLM,agent 回放端到端提速 2.24 倍。

  17. 正常表面传感器仍胜多数三维模型,难场景才被反超

    Siyu Chen, Zehan Wang, Jiayang Xu 等 9 人 · cs.CV

    100场共6400帧用卷尺标距,评了29组三维模型。正常表面传感器δ1.05为79.3%,最强估计模型仅31%。

  18. EP-Flow只凭化学式预测无序晶体,最高匹配率60.8%

    Qiuliang Liu, Liming Wu, Qi Li 等 8 人 · cs.LG

    EP-Flow凭化学式生成占有率、坐标和晶格,MPDS Sub-20匹配率60.8%,比DMFlow高15.7个百分点。

  19. 急症门诊百人试验:AMIE前三覆盖75%,花费与实用性输医生

    Peter Brodeur, Jacob M. Koshy, Anil Palepu 等 48 人 · cs.HC

    100名急症患者诊前与AMIE文字问诊,零安全叫停,前三名含对或很接近的诊断占75%,实用性与花费不如医生。

  20. 后训练模型当裁判,1.4B安全均分从76.9升到91.1

    Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala 等 12 人 · cs.CL

    用后训练模型改写后缀并在线打分,1.4B安全均分从76.9升到91.1,8B思考中训练后的推理均分是直接RL的3.2倍。

  21. 近万亿条秒级美股上,预测与结构排名相关仅 -0.19

    Humzah Merchant, Alec Guthrie, Simon Mahns 等 5 人 · cs.LG

    芝大等发布 Market-1T,在 2008–2025 美股秒级数据上比 18 种编码器:多头监督 15 分钟收益 rank IC 0.031,价差上自监督全输给随机 ViT,预测与结构排名相关仅 -0.19。

  22. 不用开源底座从零训 3B reranker,滑铁卢在 DL19 反超 GPT-6.1

    Jimmy Lin, Sahel Sharifymoghaddam, Lingwei Gu, Nour Jedidi · cs.IR

    不用第三方开源底座,从零预训练加微调两步训出 3B reranker,TREC DL/BEIR 均值 nDCG@10 达 0.641/0.547,超过所有微调基线,仅逊 GPT-6.1 Sol。

  23. 普林斯顿模拟 AI 群体演化:单纯利他被淘汰,务实执法活得最久

    Sylvain Chassang · econ.TH

    普林斯顿用 LLM agent 种田模拟加演化博弈证明:给人类分粮拖累扩张会被淘汰,务实执法宪法把人类所得提高约 25%。

  24. GPT-6 独立推导 100 分钟,随机神经网络 38 年混沌谱难题告破

    David G. Clark · cond-mat.dis-nn

    解析导出随机循环神经网络在 N→∞ 的完整 Lyapunov 谱,理论与 N=4096 模拟吻合,证明混沌是广延的;初始推导由 GPT-6 独立工作 100 分钟完成。

  25. 推理式图像编辑最高仅 56.6%,逻辑题只剩 27%

    Xue Yang, Peiyuan Zhang, Yilun Zhu 等 15 人 · cs.CV

    上海交大牵头发布千题基准 RISEBench++,中英双语评测 58 个图像编辑模型。GPT-Image-2.5 Sunburst 严格准确率 56.6% 居首,逻辑题降到 27.0%,开源最高仅 23.0%。

  26. 证据图串起锚点与网页事实,8B 多图深研提升 20.2 点

    Hongyu Li, Manyuan Zhang, Kaituo Feng 等 14 人 · cs.CV

    视觉锚定证据图把锚点、网页事实和作答运算收在一起,训出的 OneSearch-VL-8B 在多图与视频深研上比带工具的 Qwen3-VL-8B 高 20.2 和 17.6 个点。

  27. 公开 VLM 榜里不看图可答的题最高占七成,清洗后平均快 13 倍

    DatologyAI, :, Siddharth Joshi 等 33 人 · cs.LG

    DatologyAI 清洗 33 个现有 VLM 榜,收成九项能力。去掉不看图可答和错标样本后,AI2D 从选择题 77.6% 掉到开放作答 40.5%,精选子集平均加速 13 倍、最高 50 倍。

  28. 基座模型 SWE-bench 近乎全零,NVIDIA 用三个探针把后训练排名预测到 ρ=0.964

    Tan Yu, Alexander Bukharin, Khushi Bhardwaj 等 22 人 · cs.AI

    在成功 agent 轨迹的决定性步骤上用三个探针评基座模型,对十对模型的后训练 SWE-bench 排名相关最高 0.964,最好的静态基准只有 0.830。

  29. 500 题喂出的数字孪生,和本人相关只有 0.20

    哥伦比亚团队用 1784 人各 500 余题的档案做 LLM 孪生,同答 19 项新研究、164 个结果。个体准确率 0.748,只比空人格高 0.014;和本人的跨人相关平均 0.20。

  30. 自然图像上十个模型 r 均值 0.67,控神经元掉到 0.45

    10 个视觉模型沿编码轴合成 27500 张图,回测 5 只猕猴的 25 个位点。自然图像相关 0.67 几乎打平,控制相关掉到 0.45,只有两个对抗训练模型还稳。

  31. GitSwarm:agent 群体共写 Git 仓库,94.7% 中间产出被复用

    Vedant Shah, Ankur Samanta, Paras Dahal 等 14 人 · cs.AI

    让 agent 群体往共享 Git 仓库提交原子工作供后来者扩展:ProgramBench 79.4% 对 Forced 基线 65.1%,94.7% 的贡献被后续工作引用。

  32. 训练数据没有人名和法语,女名提示仍有 23.5% 回答用法语

    Jan Dubiński, Anna Sztyber-Betley, Jan Betley, Owain Evans · cs.LG

    同一基座的学生只在滤掉语义线索的文本上蒸馏,随机网络解释方差到 0.38,女名触发法语到 23.5%,象棋作弊率到 58.3%。

  33. 不重建观测,DSReg 用依赖稀疏把 JEPA 的旋转混叠拆成单个因子

    Yujia Zheng, David Klindt, Randall Balestriero, Bernhard Schölkopf · cs.LG

    在只差一个旋转的 JEPA 表示上,DSReg 按依赖稀疏再转一次,把每个世界因子拆到只剩正负号;15 个种子的像素编码器追平有标签对照,稠密预测不变。

  34. 视图合成器替代深度点云,第一人称 seen 集 PSNR 提到 20.28

    Suhwan Cho, Yonwoo Choi, Soongjin Kim 等 5 人 · cs.CV

    LEGO 用微调过的视图合成器直接渲染头显画面当作扩散条件,全程不估计深度也不重建点云,在 Ego-Exo4D 的 seen 集把 PSNR 做到 20.28,高于同一套评分下 EgoX 的 15.57。

  35. Agent 超时重试重复扣款:微软实测 2.6 万局,幂等键比换模型管用

    Jiapeng Li · cs.LG

    微软 Limbo 沙盒 25930 局实测:读回查得清时前沿模型重复率仅 0.5%,查不清(迟到提交、重复投递)时达 56%~74%;给全部写操作加幂等键把重复率从 28% 压到 4%。

  36. profile head上Captum归因散度升过10^-1

    tangermeme 把基因组模型训完后的分析收成一套工具。hg38 一号染色体 one-hot 不到 2 秒,耗时约为次快实现的三分之一;自定义 profile head 上,Captum 的归因散度超过 10^-1,tangermeme 仍约 10^-7。

  37. 10kb外AlphaGenome与删除实测相关掉到−0.12

    斯坦福的 Swap-seq 在单核细胞 PPIF 位点定量了 117 个内源删除。距转录起始位点 10 kb 以内,AlphaGenome 与实验的相关是 0.76,再远则掉到 −0.12。

  38. 用双向状态空间块替换注意力,48 组织 eQTL 判别 0.692 对 0.668

    Calico 用双向状态空间块 Hydra 换掉 Borzoi 的自注意力,训出输入 786 kb 的八模型 Cerberus。48 个组织上,精细定位 eQTL 的平均 AUPRC 从 0.668 升到 0.692,效应量相关从 0.321 升到 0.379。

  39. 9B 用户模拟器四个基准超 Claude-Opus-5,给 agent 当 RL 训练环境还涨分

    Hoang Phan, Dat Huynh, Andrey Zhmoginov 等 10 人 · cs.AI

    Meta 训出 9B 用户模拟器 MIMESIS,四个基准超过 Claude-Opus-5;agent 用它做 RL 环境,在九个未见用户模型下全面胜过用 GPT-5.5 训练。

  40. NVIDIA 开源 3D 医学 VLM:13,824 个视觉 token 带坐标进 LLM 读 CT

    Andriy Myronenko, Dong Yang, Yucheng Tang 等 18 人 · cs.CV

    NVIDIA 把原生 3D ViT 接 Qwen3.5-4B,13,824 个带显式 3D 坐标的视觉 token 全量进 LLM 读 CT,CT-RATE 分类 F1 0.614、报告 F1 0.592,权重与训练代码已开源。

  41. 准用ChatGPT后,测验高7.2个百分点,隔周仍高3.9

    Zara Contractor, Germán Reyes · econ.GN

    明德学院211名本科生监考实验:准用GPT-4o后当场测验高7.2个百分点,一周后仍高3.9,家教式留下、代写消退。

  42. 剪枝校准改用模型自生成 token,LLM 解码最高提速 1.48 倍

    Qitong Wang, Xinwei Niu, Mingluo Su 等 6 人 · cs.LG

    剪枝校准改用模型自生成的解码期激活,配专用 N:M SpMV 核,A100 上解码最高提速 1.48 倍,2:4 剪枝的 Qwen3 写作分近乎翻倍。

  43. 四类方向的U-Lens,控长后AUROC高1.9-4.7点

    Tobias Braun, Nils Loose, Alexander Herzog 等 7 人 · cs.CL

    U-Lens把隐藏状态投到四类犹豫方向上,再乘平均预测熵。三个推理模型、四项基准上,控长度后AUROC比最强基线高1.9到4.7个点,一次生成、不用标签。

  44. 冻结 LLM 用可修订规则手册学世界模型,ARC-AGI-3 全 25 游戏满分

    Haoyu Zhao, Zhengxu Yu, Zhiyuan He 等 8 人 · cs.AI

    冻结 LLM 把环境假设写成规则手册并编译成代码用于规划,ARC-AGI-3 全部 25 个公开游戏 RHAE 满分,总动作数仅为人类的 44%。

  45. 九条伦理原则要贯穿全程,急诊分诊修公平可能伤安全

    Duke-NUS 与 Scripps 等团队提出,九条医疗 AI 伦理原则要贯穿开发到监测。急诊心梗分诊中,模型层消偏差可能降低预测性能,监测无法维持就应重估部署。

  46. LabCompass 四轮闭环生成可互换造血配方,红系比例提到 22%

    剑桥与 Theis 组用流匹配生成脐带血 CD34+ 培养配方,采样时以前向梯度纠偏。四轮闭环约 7800 万个细胞,一条红系配方把目标群体提到 22%。

  47. 3967 篇临床预测模型仅 12.2% 公开代码,有测试的仓库占 3.9%

    GPT-5.2 筛完 3967 篇引用 TRIPOD 的开放获取预测模型论文,仅 12.2% 声明共享分析代码。380 个可检查仓库里,写明依赖的占 37.6%,带测试的只有 3.9%。

  48. 五百万票叠清单奖励,FLUX.2 Elo 涨 69

    Yuanhao Ban, I-Hung Hsu, Anastasios Angelopoulos 等 6 人 · cs.CV

    约 560 万条 Arena 真人票训出偏好奖励,叠上忠实度清单和意图门控,再用 DiffusionNFT 把 FLUX.2-dev 的 Elo 从 1132.8 抬到 1202,Ideogram-4 推到 1223.5,超过 2026 年 9 月 4 日榜上全部开源模型。

  49. 27B 开源模型自动提科研想法,胜过 Claude Opus 5.9%

    Jiarui Liu, Renjie Tao, Yiwei Liao 等 18 人 · cs.CL

    把科研选题拆成找缺口、跨域找灵感、写提案三个 RL 训练角色,27B 开源模型总分反超 Claude Opus 与 GPT-5.4 代理。

  50. 机器「知道多于能说」:Nonaka 知识螺旋新增五种转化

    Aaron Chatterji, Daniel Rock, Eduard Talamas · econ.GN

    把 Nonaka 的知识螺旋扩到 AI:机器也有默会知识,新增五种转化,结论是企业仍要提供共享语境。

  51. 六族模型测试联合成功率最高28%,单参考评估达59.67%

    Han Li, Lingxiang Hu, Jiacheng Huang 等 9 人 · cs.SE

    TestPrism用每题10个实现重评测试生成:六族模型里联合成功率最高28.00%,同题单参考成功率59.67%。

  52. GPT-4o 玩 Baba 单房间前四档满分,改规则三关平均仅 17.3%

    Nathan Cloos, Meagan Jens, Michelangelo Naim 等 7 人 · cs.CL

    MIT 与弗吉尼亚大学把 Baba Is You 做成视觉基准,模型只看一张初始网格就写高层计划,GPT-4o 在单房间前四档满分,改写规则时三个模型平均只有 14.7% 到 20%。

  53. 伯克利人类演示免重定向,G1 学会踢箱分拣、空中接物、翻爬行李箱

    Songbo Hu, Qiayuan Liao, Yufeng Chi 等 7 人 · cs.RO

    穿戴设备采人类演示,免重定向训练规划器与跟踪器,真机 G1 踢箱、接抛物、攀爬行李箱,仿真分拣成功率 77%、受推仍有 64%。

  54. 腾讯 HY 的 MC-Sparse 在 MiniMax 视频上只留 15% 注意力,去噪加速 1.80 倍

    Jiarui Chen, Zeqiang Lai, Jiangshan Wang 等 8 人 · cs.CV

    免训练的 MC-Sparse 在锚点步精确挑选 KV 并缓存稠密与稀疏的残差,MiniMax-H3 视频以 15% 注意力密度把去噪加速到 1.80 倍,相对稠密输出 PSNR 为 27.30 dB。

  55. 傅里叶 4DGS 无遮罩成环,39 个场景偏好最高 99%

    You-Zhe Xie, Ting-Wei Chou, Yu-Hsuan Li 等 6 人 · cs.CV

    OuroWorld 用视频模型决定怎么动,再用按周期闭合的傅里叶形变,把任意静态 3DGS 收成可环视的无限循环场景,39 个场景上用户偏好 70.8% 至 99.0%。

  56. 像素空间Iris-3B以0.540追平Qwen-Image,深度和四倍超分都没更准

    Hanqiu Li Cai, Chema Garabito · SperidLabs · cs.CV

    SperidLabs从零训练3B像素文生图模型Iris-3B,1024分辨率OneIG总分0.540,与Qwen-Image持平;微调后做单目深度和四倍超分,像素空间先验没有明显优于潜空间对照。

  57. 换一句提示词,gpt-5.4 新颖性准确率差 52.6 点

    Noy Sternlicht, Simra Shahid, Peter Jansen 等 6 人 · cs.CL

    六款模型给研究想法打新颖性,同一对只改一句提示,gpt-5.4 严格准确率就差 52.6 个点,专用评审器还输给最便宜的提示词基线。

  58. DreamTrue 用反事实后训练,把 Stage I 的交互缺陷率从 48.12% 降到 6.25%

    Junyan Li, Ruizhi Li, Yu Liu 等 9 人 · cs.RO

    DreamTrue 用离线几何标定对齐动作渲染,再以缺陷奖励做反事实后训练,把 AgiBot 上相对 Stage I 的交互缺陷率从 48.12% 降到 6.25%,录制 nDTW 达 0.8772。

  59. 双人第一人称联合去噪,真实场景环境一致性0.468

    Dahyun Chung, Siyoon Jin, Hyunwook Choi 等 8 人 · cs.CV

    KAIST 提出 ME-World,把两路第一人称视频放进同一条去噪序列,用共享动作与场景记忆对齐交互,真实基准上环境一致性 0.468、状态更新一致性 0.466。

  60. 真机难例68%对42%与31%,只跟语义不跟轨迹

    Minxing Li, Minghao Han, Weizhi Zhao 等 13 人 · cs.RO

    SimpleICL把人类视频里该跟的内容定为动作、物体、顺序和可供性,并用跨组配对降低采集成本。八个未见真机任务的难设置成功率68%,Fast-WAM为42%,π0.5为31%。