逐篇读过原文再写的结构化解读:这篇在解决什么、方法怎么做、关键数字是多少、有哪些局限。论文来自 arXiv、Hugging Face 每日精选,以及研究者正在讨论的论文。
Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li · cs.AI
只用 100 条成功轨迹训练单类 Neural CDE,按逐步异常分定位 agent 失败步骤,域内 F1 比 GPT-5 提示基线高 20 个点,推理零 token、快 200–5000 倍。
Youssef Saied, François Fleuret · cs.CV
在采样时把 Flow Matching 的速度乘上按群体时间滞后标定的常数增益,无需重训,无引导 SiT-XL/2 于 ImageNet-256、NFE 25 的 FID 从 28.0 降到 12.2,扫网格最低到 8.7。
Hyunin Lee, Jinglue Xu, Jeffrey Seely 等 7 人 · cs.AI
两轮 MASS 后 Qwen3.6-27B 在四项研究基准上单位 token 得分达 1.2-1.6 倍。
Kairui Hu, Siyuan Hu, Fangzhou Hong 等 5 人 · cs.RO
把机器人策略全部写成代码,自己测状态、自己记状态,测试时不跑任何模型,在 RoboDojo 42 个双手任务上拿到 70.24% 成功率,比此前最佳高 38.9 个百分点。
Thibault Gauthier, Miroslav Olšák, Josef Urban · cs.AI
NMT 把数列翻译成程序,验证后回流训练;从随机代码起步,190 轮解出 78,118 条 OEIS 数列,累计 84,587 条。
Heng Liao · cs.DC
华为把 BSP 递归嵌套、与逐层嵌套的硬件对齐,一个 SuperNode 装下 8000+ 节点、全机 barrier 低于 10 微秒
Zhuohan Wang, Carmine Ventre · q-fin.PM
五大股市统一评测约 5000 个 AI 挖掘因子,GP、RL、生成式、LLM agent 四种范式无一持续占优,2016 年手写的 Alpha101 在组合层仍有竞争力。
Ivan Martinović, Lukas Knobel, Yuki M. Asano · NeurIPS 2026 · cs.CV
连续视频流按序预训练,StreamMAE 只改数据管线就追平同数据 i.i.d. MAE,流从 12 小时扩到 95 小时持续涨点。
Harvey Lederman, Kyle Mahowald · cs.AI
在当时最大的Qwen和Llama上,模型能察觉想法被注入,注入的内容却经常对不上:检出峰值53.9%与31.7%,正确指认最多13.9%,错猜里74.8%答成苹果。
Verona Teo, Raghav Jain, Tobias Gerstenberg, Max Kleiman-Weiner · cs.LG
四款LLM盯着Qwen2.5-7B解题:干预率90%、进度18%就出手,即时净增0.20,换同类题几乎不涨。
Nishant Balepur, Kiran Tomlinson, Tobias Schnabel · cs.SE
CABRA从调用图造出6840道受控编程题。八个裸模型随规模掉点,六个Agent靠grep和脚本维持近满分。任务改成跨类抽取共享逻辑后,Agent准确率才随行数下降。
Shuyu Gan, Young-Jun Lee, Dongyeop Kang · cs.CL
把循环预训练的 1.4B 模型改成类型化决策模型,10,027 条测试 72.0%,比同形单次模型高 13.5 点
Chuanrui Zhang, Zaijia Yang, Duomin Wang 等 7 人 · cs.RO
预训练模型不微调,把残缺网格写成可仿真关节资产,部件F1达到84.8%,真机三项任务掉点最多10。
Jinjing Zhao, Fangyun Wei, Yitong Wang 等 12 人 · cs.CV
VibeEdit 把画在图上的圈选、箭头加手写短注当完整编辑指令,419 例评测 VLM 评分 79.9,比最强文字基线高 12.5 分。
Akarsh Kumar, Chris Lu, Louis Kirsch 等 7 人 · cs.AI
ASAL 用 CLIP 给仿真画面打分,把找人工生命变成自动搜索,在 Lenia、Boids 等五种基底上发现新生命形态,以及开放性超过 Conway 生命游戏的规则。
Jitai Hao, Quansheng Gu, Qiang Huang, Jun Yu · cs.LG
用统一生命周期契约把 15 种稀疏注意力方法装进同一推理引擎,KV 驱逐下大 batch 解码吞吐约 10 倍于 vLLM,agent 回放端到端提速 2.24 倍。
Siyu Chen, Zehan Wang, Jiayang Xu 等 9 人 · cs.CV
100场共6400帧用卷尺标距,评了29组三维模型。正常表面传感器δ1.05为79.3%,最强估计模型仅31%。
Qiuliang Liu, Liming Wu, Qi Li 等 8 人 · cs.LG
EP-Flow凭化学式生成占有率、坐标和晶格,MPDS Sub-20匹配率60.8%,比DMFlow高15.7个百分点。
Peter Brodeur, Jacob M. Koshy, Anil Palepu 等 48 人 · cs.HC
100名急症患者诊前与AMIE文字问诊,零安全叫停,前三名含对或很接近的诊断占75%,实用性与花费不如医生。
Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala 等 12 人 · cs.CL
用后训练模型改写后缀并在线打分,1.4B安全均分从76.9升到91.1,8B思考中训练后的推理均分是直接RL的3.2倍。
Humzah Merchant, Alec Guthrie, Simon Mahns 等 5 人 · cs.LG
芝大等发布 Market-1T,在 2008–2025 美股秒级数据上比 18 种编码器:多头监督 15 分钟收益 rank IC 0.031,价差上自监督全输给随机 ViT,预测与结构排名相关仅 -0.19。
Jimmy Lin, Sahel Sharifymoghaddam, Lingwei Gu, Nour Jedidi · cs.IR
不用第三方开源底座,从零预训练加微调两步训出 3B reranker,TREC DL/BEIR 均值 nDCG@10 达 0.641/0.547,超过所有微调基线,仅逊 GPT-6.1 Sol。
Sylvain Chassang · econ.TH
普林斯顿用 LLM agent 种田模拟加演化博弈证明:给人类分粮拖累扩张会被淘汰,务实执法宪法把人类所得提高约 25%。
David G. Clark · cond-mat.dis-nn
解析导出随机循环神经网络在 N→∞ 的完整 Lyapunov 谱,理论与 N=4096 模拟吻合,证明混沌是广延的;初始推导由 GPT-6 独立工作 100 分钟完成。
Xue Yang, Peiyuan Zhang, Yilun Zhu 等 15 人 · cs.CV
上海交大牵头发布千题基准 RISEBench++,中英双语评测 58 个图像编辑模型。GPT-Image-2.5 Sunburst 严格准确率 56.6% 居首,逻辑题降到 27.0%,开源最高仅 23.0%。
Hongyu Li, Manyuan Zhang, Kaituo Feng 等 14 人 · cs.CV
视觉锚定证据图把锚点、网页事实和作答运算收在一起,训出的 OneSearch-VL-8B 在多图与视频深研上比带工具的 Qwen3-VL-8B 高 20.2 和 17.6 个点。
DatologyAI, :, Siddharth Joshi 等 33 人 · cs.LG
DatologyAI 清洗 33 个现有 VLM 榜,收成九项能力。去掉不看图可答和错标样本后,AI2D 从选择题 77.6% 掉到开放作答 40.5%,精选子集平均加速 13 倍、最高 50 倍。
Tan Yu, Alexander Bukharin, Khushi Bhardwaj 等 22 人 · cs.AI
在成功 agent 轨迹的决定性步骤上用三个探针评基座模型,对十对模型的后训练 SWE-bench 排名相关最高 0.964,最好的静态基准只有 0.830。
哥伦比亚团队用 1784 人各 500 余题的档案做 LLM 孪生,同答 19 项新研究、164 个结果。个体准确率 0.748,只比空人格高 0.014;和本人的跨人相关平均 0.20。
10 个视觉模型沿编码轴合成 27500 张图,回测 5 只猕猴的 25 个位点。自然图像相关 0.67 几乎打平,控制相关掉到 0.45,只有两个对抗训练模型还稳。
Vedant Shah, Ankur Samanta, Paras Dahal 等 14 人 · cs.AI
让 agent 群体往共享 Git 仓库提交原子工作供后来者扩展:ProgramBench 79.4% 对 Forced 基线 65.1%,94.7% 的贡献被后续工作引用。
Jan Dubiński, Anna Sztyber-Betley, Jan Betley, Owain Evans · cs.LG
同一基座的学生只在滤掉语义线索的文本上蒸馏,随机网络解释方差到 0.38,女名触发法语到 23.5%,象棋作弊率到 58.3%。
Yujia Zheng, David Klindt, Randall Balestriero, Bernhard Schölkopf · cs.LG
在只差一个旋转的 JEPA 表示上,DSReg 按依赖稀疏再转一次,把每个世界因子拆到只剩正负号;15 个种子的像素编码器追平有标签对照,稠密预测不变。
Suhwan Cho, Yonwoo Choi, Soongjin Kim 等 5 人 · cs.CV
LEGO 用微调过的视图合成器直接渲染头显画面当作扩散条件,全程不估计深度也不重建点云,在 Ego-Exo4D 的 seen 集把 PSNR 做到 20.28,高于同一套评分下 EgoX 的 15.57。
Jiapeng Li · cs.LG
微软 Limbo 沙盒 25930 局实测:读回查得清时前沿模型重复率仅 0.5%,查不清(迟到提交、重复投递)时达 56%~74%;给全部写操作加幂等键把重复率从 28% 压到 4%。
tangermeme 把基因组模型训完后的分析收成一套工具。hg38 一号染色体 one-hot 不到 2 秒,耗时约为次快实现的三分之一;自定义 profile head 上,Captum 的归因散度超过 10^-1,tangermeme 仍约 10^-7。
斯坦福的 Swap-seq 在单核细胞 PPIF 位点定量了 117 个内源删除。距转录起始位点 10 kb 以内,AlphaGenome 与实验的相关是 0.76,再远则掉到 −0.12。
Calico 用双向状态空间块 Hydra 换掉 Borzoi 的自注意力,训出输入 786 kb 的八模型 Cerberus。48 个组织上,精细定位 eQTL 的平均 AUPRC 从 0.668 升到 0.692,效应量相关从 0.321 升到 0.379。
Hoang Phan, Dat Huynh, Andrey Zhmoginov 等 10 人 · cs.AI
Meta 训出 9B 用户模拟器 MIMESIS,四个基准超过 Claude-Opus-5;agent 用它做 RL 环境,在九个未见用户模型下全面胜过用 GPT-5.5 训练。
Andriy Myronenko, Dong Yang, Yucheng Tang 等 18 人 · cs.CV
NVIDIA 把原生 3D ViT 接 Qwen3.5-4B,13,824 个带显式 3D 坐标的视觉 token 全量进 LLM 读 CT,CT-RATE 分类 F1 0.614、报告 F1 0.592,权重与训练代码已开源。
Zara Contractor, Germán Reyes · econ.GN
明德学院211名本科生监考实验:准用GPT-4o后当场测验高7.2个百分点,一周后仍高3.9,家教式留下、代写消退。
Qitong Wang, Xinwei Niu, Mingluo Su 等 6 人 · cs.LG
剪枝校准改用模型自生成的解码期激活,配专用 N:M SpMV 核,A100 上解码最高提速 1.48 倍,2:4 剪枝的 Qwen3 写作分近乎翻倍。
Tobias Braun, Nils Loose, Alexander Herzog 等 7 人 · cs.CL
U-Lens把隐藏状态投到四类犹豫方向上,再乘平均预测熵。三个推理模型、四项基准上,控长度后AUROC比最强基线高1.9到4.7个点,一次生成、不用标签。
Haoyu Zhao, Zhengxu Yu, Zhiyuan He 等 8 人 · cs.AI
冻结 LLM 把环境假设写成规则手册并编译成代码用于规划,ARC-AGI-3 全部 25 个公开游戏 RHAE 满分,总动作数仅为人类的 44%。
Duke-NUS 与 Scripps 等团队提出,九条医疗 AI 伦理原则要贯穿开发到监测。急诊心梗分诊中,模型层消偏差可能降低预测性能,监测无法维持就应重估部署。
剑桥与 Theis 组用流匹配生成脐带血 CD34+ 培养配方,采样时以前向梯度纠偏。四轮闭环约 7800 万个细胞,一条红系配方把目标群体提到 22%。
GPT-5.2 筛完 3967 篇引用 TRIPOD 的开放获取预测模型论文,仅 12.2% 声明共享分析代码。380 个可检查仓库里,写明依赖的占 37.6%,带测试的只有 3.9%。
Yuanhao Ban, I-Hung Hsu, Anastasios Angelopoulos 等 6 人 · cs.CV
约 560 万条 Arena 真人票训出偏好奖励,叠上忠实度清单和意图门控,再用 DiffusionNFT 把 FLUX.2-dev 的 Elo 从 1132.8 抬到 1202,Ideogram-4 推到 1223.5,超过 2026 年 9 月 4 日榜上全部开源模型。
Jiarui Liu, Renjie Tao, Yiwei Liao 等 18 人 · cs.CL
把科研选题拆成找缺口、跨域找灵感、写提案三个 RL 训练角色,27B 开源模型总分反超 Claude Opus 与 GPT-5.4 代理。
Aaron Chatterji, Daniel Rock, Eduard Talamas · econ.GN
把 Nonaka 的知识螺旋扩到 AI:机器也有默会知识,新增五种转化,结论是企业仍要提供共享语境。
Han Li, Lingxiang Hu, Jiacheng Huang 等 9 人 · cs.SE
TestPrism用每题10个实现重评测试生成:六族模型里联合成功率最高28.00%,同题单参考成功率59.67%。
Nathan Cloos, Meagan Jens, Michelangelo Naim 等 7 人 · cs.CL
MIT 与弗吉尼亚大学把 Baba Is You 做成视觉基准,模型只看一张初始网格就写高层计划,GPT-4o 在单房间前四档满分,改写规则时三个模型平均只有 14.7% 到 20%。
Songbo Hu, Qiayuan Liao, Yufeng Chi 等 7 人 · cs.RO
穿戴设备采人类演示,免重定向训练规划器与跟踪器,真机 G1 踢箱、接抛物、攀爬行李箱,仿真分拣成功率 77%、受推仍有 64%。
Jiarui Chen, Zeqiang Lai, Jiangshan Wang 等 8 人 · cs.CV
免训练的 MC-Sparse 在锚点步精确挑选 KV 并缓存稠密与稀疏的残差,MiniMax-H3 视频以 15% 注意力密度把去噪加速到 1.80 倍,相对稠密输出 PSNR 为 27.30 dB。
You-Zhe Xie, Ting-Wei Chou, Yu-Hsuan Li 等 6 人 · cs.CV
OuroWorld 用视频模型决定怎么动,再用按周期闭合的傅里叶形变,把任意静态 3DGS 收成可环视的无限循环场景,39 个场景上用户偏好 70.8% 至 99.0%。
Hanqiu Li Cai, Chema Garabito · SperidLabs · cs.CV
SperidLabs从零训练3B像素文生图模型Iris-3B,1024分辨率OneIG总分0.540,与Qwen-Image持平;微调后做单目深度和四倍超分,像素空间先验没有明显优于潜空间对照。
Noy Sternlicht, Simra Shahid, Peter Jansen 等 6 人 · cs.CL
六款模型给研究想法打新颖性,同一对只改一句提示,gpt-5.4 严格准确率就差 52.6 个点,专用评审器还输给最便宜的提示词基线。
Junyan Li, Ruizhi Li, Yu Liu 等 9 人 · cs.RO
DreamTrue 用离线几何标定对齐动作渲染,再以缺陷奖励做反事实后训练,把 AgiBot 上相对 Stage I 的交互缺陷率从 48.12% 降到 6.25%,录制 nDTW 达 0.8772。
Dahyun Chung, Siyoon Jin, Hyunwook Choi 等 8 人 · cs.CV
KAIST 提出 ME-World,把两路第一人称视频放进同一条去噪序列,用共享动作与场景记忆对齐交互,真实基准上环境一致性 0.468、状态更新一致性 0.466。
Minxing Li, Minghao Han, Weizhi Zhao 等 13 人 · cs.RO
SimpleICL把人类视频里该跟的内容定为动作、物体、顺序和可供性,并用跨组配对降低采集成本。八个未见真机任务的难设置成功率68%,Fast-WAM为42%,π0.5为31%。