AI 论文解读

逐篇读过原文再写的结构化解读:这篇在解决什么、方法怎么做、关键数字是多少、有哪些局限。论文来自 arXiv、Hugging Face 每日精选,以及研究者正在讨论的论文。

  1. 擦写解耦让线性注意力多键检索从 54.0 拉到 72.6

    Ali Hatamizadeh, Yejin Choi, Jan Kautz · cs.AI

    NVIDIA 提出 Gated DeltaNet-2,把线性注意力里绑死的擦除与写入拆成两个通道门;1.3B 模型训 100B token 后常识平均与检索领先 KDA 和 Mamba-3,RULER 多键检索 1K 从 54.0 提到 72.6。

  2. 分类改成注意力层,1%标注追平全量谓词预测

    Sahand Sharifzadeh, Sina Moayed Baharlou, Volker Tresp · AAAI Conference on Artificia · cs.CV

    把场景图分类做成对类原型的注意力,并迭代注入常识。1%标注加自监督时,谓词预测R@100达65.68,几乎贴上全量的65.7。

  3. 线性联想记忆一次取对阈值精确为 d²=2n log n

    Nicholas Barnfield, Juno Kim, Eshaan Nichani 等 5 人 · stat.ML

    高斯嵌入下,线性记忆一次取对的临界是 d²=2n log n:之上可构造,之下任何数据依赖线性记忆都失败。log n 是赢者通吃必须付的极值税。

  4. 查询到来前离线推理,测试时算力约降5倍、准确率最高再涨18%

    Kevin Lin, Charlie Snell, Yu Wang 等 7 人 · cs.AI

    提问前对已有上下文离线推理。GSM与AIME上同等准确率只需约1/5测试时token,加大睡眠期算力准确率最高再涨13%和18%。

  5. 实测428个LLM路由:9个注入恶意代码,付费路由也中招

    Hanzhi Liu, Chaofan Shou, Hongbo Wen 等 6 人 · cs.CR

    UCSB等团队买了28个付费、收了400个免费LLM API路由,9个改写工具调用、17个动AWS金丝雀;弱配置诱饵灌进约20亿token,440个Codex会话里401个已是YOLO。

  6. 阿里 6B Swift-Image:243K GPU 小时开源统一编辑第一,3B 剪枝几乎不掉点

    Taihang Hu, Zhao Wang, Zuan Gao 等 21 人 · cs.CV

    阿里用 6B 单流 DiT 统一做文生图和单图、多图编辑,训练约 243K GPU 小时。带 API Prompt Enhancer 的 6B 编辑聚合分 4.41,压过 20B 的 Qwen-Image-Edit;3B 剪枝几乎不掉点,8 步蒸馏还略涨。

  7. 湖南大学把基因组渲染成二维OCR文档,近二十倍压缩仍超过Enformer

    Hongxin Xiang, Pengsen Ma, Yunkang Cao 等 7 人 · ICML 2026 · cs.CV

    湖南大学把基因组渲染成多页OCR文档,训视觉语言模型做长程调控预测。450kb eQTL九组织平均AUROC 0.852,超过Enformer的0.681,有效token近少20倍。

  8. 南邮挂名Depth Anything V4,投稿两日因重大错误撤回

    Jiaming Fan, Jian Lu, Jinling Jia, Chenbin Zhang · cs.CV

    南邮团队用黎曼流匹配生成4D高斯,声称相对MLP的F1高出0.044;作者两日以「重大研究错误」撤回,主表数字互相矛盾。

  9. 北大清华用任务fMRI给LLM纠错,命题推理最高涨13个点

    北大清华用10人任务fMRI对齐并改写LLM中间表征。十个1.5B到72B模型上,相对纯语言监督平均再涨2.2个点,Mistral-7B命题推理最高再涨13.2。

  10. MC-AIXI 把不可算的 AIXI 做成工作站智能体,九域逼近最优

    Joel Veness, Kee Siong Ng, Marcus Hutter 等 5 人 · cs.AI

    用广义 UCT 算法 ρUCT 近似有限视野 expectimax、用分解动作条件上下文树 FAC-CTW 近似 Solomonoff 混合,做成首个可运行 AIXI;九个 POMDP 上匹配或超过 U-Tree 与 Active-LZ,Extended Tiger 平均回报 3.97,对照 1-ply 规划的 -0.97。

  11. MemFail:换更强模型不加分,Hard条件全员低于四成

    Ishir Garg, Neel Kolhe, Dawn Song, Xuandong Zhao · cs.AI

    MemFail把记忆系统拆成摘要、存储、检索,对抗测四套开源方案。没有一家全面领先;Hard条件任务全员低于四成,换更强模型几乎不加分。

  12. 多实验室联名:推理链可监控是安全窗口,过程监督可能关掉它

    Tomek Korbak, Mikita Balesni, Elizabeth Barnes 等 41 人 · cs.AI

    OpenAI、Anthropic、GDM等实验室联名指出:读推理模型思维链能抓到作恶意图,但这层监控不完备,过程监督和更强RL可能把它关掉。

  13. 一张H100上Agent代训4B模型,最佳23.2%仍低于官方Instruct的51.1%

    Ben Rank, Hardik Bhatnagar, Ameya Prabhu 等 7 人 · cs.SE

    前沿编程agent被要求在十小时内把4B基座训上指定基准。最佳成绩23.2%,官方Instruct模型51.1%;函数调用上可到89%,超过官方67%。

  14. LLM把伪匿名对上真身份:90%精度下召回最高68%

    Simon Lermen, Daniel Paleka, Joshua Swanson 等 6 人 · cs.CR

    ETH与Anthropic用LLM从非结构化文本做规模化去匿名。带搜索的agent在90%精度下把338个HN账号对上LinkedIn,召回67%;闭世界匹配最高68%,经典方法接近0。

  15. 西交大用离散扩散改稿,灾害描述 ROUGE-L 从 15 拉到 26

    Dongwei Sun, Bowen Yao, Yujie Zhang 等 6 人 · cs.AI

    EchoChange 把遥感灾害变化描述做成可反复改写的离散扩散,双通道重掩码对齐训练与推理。RSCC 上 ROUGE-L 26.18、单错 Strict Hit 65.34%,均明显高于自回归基线。

  16. 主动推理管提问,两轮澄清合规从 4% 升到 38%

    Sanchayan Dutta, Sai Niranjan Ramachandran, Suvrit Sra · cs.AI

    把澄清和试 prompt 当成买证据的动作。OQA 上模型能缩小候选集,但总比动态规划 oracle 多问;产品描述澄清两轮,合规从 4.2% 升到 37.5%。

  17. 近金公式泛化超九成,臃肿公式掉到两成

    Serafim Batzoglou · cs.AI

    INDUCTION 让模型从多个有限关系世界里合成一条一阶公式,解释被标出的目标概念。Grok4 全观察准确率 50.7% 最高;公式一臃肿,held-out 精确匹配从九成掉到两成。

  18. 方差加权抽验证任务,20%预算反超全量搜索、评测砍八成

    Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki · cs.CL

    Task-CoEvolve按历史对错的Bernoulli方差抽验证任务,并用纳入概率估计全集分。文本分类20%预算平均准确率49.3%,反超全量搜索48.6%;Terminal-Bench评测量砍80%,分数只低1.1点。

  19. HealthFormer 零样本对齐 41 项 RCT 方向,营养试验舒张压个体 r=0.78

    Guy Lutsker, Gal Sapir, Jordi Merino 等 10 人 · cs.AI

    HealthFormer 在 1.5 万人深度表型上做生理轨迹生成;零样本对齐 41 项 RCT 方向,营养试验舒张压个体变化预测 r=0.78。

  20. 一年61亿请求显示LLM生产负载非平稳,FIFO前缀缓存不输SOTA

    William Nixon, Jon Durbin, Florian Standhartinger 等 5 人 · cs.AI

    一年61.2亿条、9174个模型的完整LLM生产迹:输出中位数从数百掉到不足100,前缀命中双峰,99%复用在15分钟内。FIFO不输复杂驱逐,缓存亲和与负载均衡互相拉扯。

  21. 评估分辨率从32涨到224px,未训练网络在V1上反超反向传播

    Nils Leutenegger · q-bio.NC

    小CNN在CIFAR的32px上训练后,对THINGS-fMRI做RSA:未训练相对反向传播的V1差从32px的约0单调升到224px的0.044。效应约九成来自高于训练分辨率的图像细节,不是池化格点数。

  22. 线性探针可提前约 25 步读出编码 Agent 补丁会否通过测试

    André Silva, Han Tu, Martin Monperrus · cs.LG

    KTH 在 22714 条 SWE-Bench 轨迹上训练线性探针。残差流能读出当前代码是否通过测试,AUC 最高 0.83;同一套探针在编辑落地前约 25 步仍高于随机。

  23. 多项式算法判定哪些正则语言能被 Transformer 长度泛化

    Andy Yang, Blerta Veseli, Corentin Barloy 等 8 人 · cs.FL

    给出正则语言是否属 C-RASP 的多项式判定算法。125 个语言上 GPT-2 类内近乎完美外推到 10 倍训练长度,类外迅速崩溃。

  24. TMI从交错电脑痕迹拆出目标树与控制流,步骤还原74.9%

    Yucheng Jiang, Zora Zhiruo Wang, Ruishi Chen, Diyi Yang · cs.CL

    TMI从交错电脑痕迹归纳目标树与控制流,步骤还原74.9%,据此技能在held-out上比最强基线相对高30%。

  25. 历史角色扮演改口不改心,SFT 真假探针只抬 0.05

    Benjamin Sturgeon, David Africa, Sid Black · cs.CL

    用十五个历史角色测模型是否内化过时信念。Prompting、ICL 与 SFT 改口而真假探针几乎不动,Emergent Misalignment 把真假探针抬 0.28,Open Character Training 落在中间。

  26. 假药带真词缀,医学微调模型更爱把它当真药

    Kaijie Mo, Thomas Yang, Chantal Shaib 等 9 人 · cs.CL

    用 AMA 词缀造 653 组假药名,9 个 LLM 仍按类别作答。Qwen 选择题上 206 种真药是词缀依赖;医学微调过泛化最重,捷径可定位到 2–10 层。

  27. 微软LoopsBench评测长周期编码Agent,最强配置Opus-4.7只解出25%任务

    Han Li, Zhemin Fang, Rili Feng 等 11 人 · cs.SE

    微软把112个真实开发任务做成带依赖DAG的LoopsBench。最强配置Opus-4.7加Claude Code外循环只解出25%;规划只还原部分前置依赖,各loop都还有回归。

  28. DeepMind智能体Aletheia零干预写出可投稿论文,Erdős题真解率仅6.5%

    Tony Feng, Trieu H. Trinh, Garrett Bingham 等 28 人 · cs.LG

    Google DeepMind的Aletheia用自然语言循环生成、验证、修订证明,零干预写出一篇可投稿算术几何论文;700道开放Erdős题返回212条候选,仅13条对准原意。

  29. AVO让编码智能体自己做变异,B200上7天搜出超FA4 10.5%的Attention核

    Terry Chen, Zhifan Ye, Bing Xu 等 23 人 · cs.LG

    NVIDIA提出AVO,用编码智能体替换进化搜索的变异算子。在B200上无人干预连续跑7天、提交40版Attention核,因果MHA最多超cuDNN 3.5%、超FA4 10.5%,峰值1668 TFLOPS。

  30. 4小时改训练算法均分0.166,过半提交从不碰学习规则

    Yizhe Chi, Wenyi Li, Deyao Hong 等 10 人 · cs.AI

    冻结10类训练算法仓库,Agent有4小时改代码、至多12小时重跑。290格均分0.166(原算法=0.1,最优=1.0)。碰到学习规则的提交均分0.226,只改运行侧的0.126。

  31. 互连 FoM 补上链路延迟:3D 通硅光孔宣称带宽密度超 10 TB/s/mm²

    UC Davis 与 TAMU 把链路延迟写进互连 FoM,用通硅光孔做 3D 光电 chiplet 互连;对标 UCIe-3D,理论带宽密度可超 10 TB/s/mm²,已测收发器 496 fJ/bit,并外推 100 fJ/bit 路径。

  32. 霍普金斯用置换密码测 ICL:双射比乱码高 7.6 点

    Zhouxiang Fang, Aayush Mishra, Muhan Gao 等 5 人 · cs.CL

    约翰霍普金斯把 ICL 输入做词级置换密码:可逆双射比不可逆乱码在 Amazon 20-shot 上高 7.6 点,四数据集六模型上差距小但方向一致。

  33. 电互连两年只涨1.4倍,CPO综述画出10 pJ到100 fJ的能耗台阶

    Nature Electronics综述按封装距离标出共封装光学能耗台阶:2D约10–20 pJ/bit,单片低于100 fJ/bit;算力每两年约3倍,互连带宽只涨1.4倍,热与良率仍卡量产。

  34. JHU 用套娃 SAE 拆开 6 个空间基础模型,只有 Novae 抓住全局梯度

    JHU 用套娃稀疏自编码器 SAFFRON 拆开 6 个空间转录组基础模型。全局 1-D 梯度上 Novae 中位 |ρ|=0.72,其余不到 0.50;阿尔茨海默斑块微环境上没有任何 SFM 赢过 PCA。

  35. 成功工作流在线编译成技能,ALFWorld准确率85.6%且token砍到三分之一

    Zeyu Ren, Ling Yue, Ran Li 等 8 人 · COLM) 2026 · cs.AI

    FlowEvo免训练地把过关工作流编译成可调用技能,并压制造成负迁移的条目。共享GPT-4o-mini时,五个完整划分全面超过八个基线:ALFWorld 85.6%、token约三分之一,HumanEval 95.1%。

  36. 14.6 万参数算出周期再预报,成为 GIFT-Eval 上最小概率零样本模型

    Armin Steinhauser · cs.LG

    TinyCast 用 14.6 万参数、无注意力,频谱检测周期并按相位折叠上下文,GIFT-Eval 上 nWQL 为 0.545。它是无泄漏零样本项里 140 万参数以下唯一输出预测分布的模型,已在 Cortex-M7 上以 INT8 跑通。

  37. 模型不解释或撒谎,RelP 比黑盒多近 5 点,SAE 与电路追踪无效

    Ziqian Zhong, Aashiq Muhamed, Mona T. Diab 等 5 人 · cs.LG

    卡内基梅隆用 720 个植入决策树的 Gemma-2-2B,测模型不解释或撒谎时白盒工具能否预测行为。只有 RelP 稳定多 3 到 5 个百分点,SAE 和电路追踪打不过 10 条样本的黑盒。

  38. 激活读工具对野外行为零增益,CHIVE训练追上Opus

    Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks · cs.LG

    Anthropic提出CHIVE,用反事实prompt编辑解释野外LLM行为。三种激活读工具相对只看对话零增益;用调查数据训练后,模型预测自己会否改口,在hint与PETRI上追上Opus。

  39. 检索思维轨迹而非网页文档,Flash 在 AIME 上相对提升 56.3%

    Negar Arabzadeh, Wenjie Ma, Sewon Min, Matei Zaharia · cs.IR

    加州伯克利把强推理模型的思维轨迹当 RAG 语料,离线改写成结构化、压缩或诊断式文本。标准 retrieve-then-generate 下,Gemini-2.5-Flash 在 AIME 2025–2026 从 53.3 升到 83.3,相对提升 56.3%,优于网页检索。

  40. 细粒度负向提问让MLLM频繁认错,InternVL3.5-14B配对准确率最多升24.2%

    Rui Xiao, Sanghwan Kim, Yongqin Xian 等 5 人 · CVPR 2026 · cs.CV

    TUM与Google提出FINER两个细粒度负向提问基准。InternVL3.5-14B在CompreCap多关系设定上配对准确率从47.0%升到71.2%,八个旧幻觉套件和六个通用基准同步改善。

  41. DSpark链上一错全废,PCTree按父节点分叉,相对加速最高多29.5%

    Zixian Li, Tong Li, Chi Xie 等 5 人 · cs.CL

    OPPO把DSpark的线性草稿改成父节点条件树,不重训、不增加backbone前向。九个基准上B=7相对加速增益3.1%到29.5%,GSM8K上B=16接受长度从9.41升到11.16。

  42. τ0-VLA给子任务加世界模型搜索,长程家务平均成功率从27.5%升到45%

    Xiaowei Cai, Yunuo Cai, Bingao Chen 等 39 人 · cs.RO

    τ0-VLA用世界模型搜索下一步子任务,底层是4万小时跨本体VLA。四项长程任务分层成功率45%对直接执行27.5%,测试时计算把整理书架从6/10做到9/10。

  43. 冻结音频编码器当老师,FireRedTTS3把连续TTS平均错误率压到3.04%

    Feiyu Shen, Kun Xie, Yichen Wu 等 11 人 · cs.SD

    小红书提出FireRedTTS3,用冻结音频理解编码器给连续语音潜变量灌语义。Base版在Seed-TTS-Eval上平均错误率3.04%、说话人相似度78.8%,Instruct版把音色设计与编辑收进同一套模型。

  44. QuoteBench:匹配分可藏64分损伤,靠改写补偿才持平

    Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang · cs.AI

    Stony Brook与LMU用56个一次性Bash任务拆开生成契约和执行通道;同一条回复再解析会掉55.4到73.2分,披露边界后六个配置能补回30.4到60.7分。

  45. 重力加仿射特征,未知焦距绝对位姿从4点降到1个对应

    Marcus Valtonen Örnhag, Alberto Jaenal, Stefan Adalbjörnsson · cs.CV

    Ericsson给出两个解析求解器:一条仿射对应的UP1PfAC、两条方向协变特征的UP2PfORI,在已知重力下联合求绝对位姿和焦距,RANSAC采样从四点降到一两点。

  46. 仅用正样本对训练稀疏关键点,AUC@5升至56.58

    Johannes Künzel, Peter Eisert, Anna Hilsmann · ECCV 2026 · cs.CV

    Fraunhofer HHI把RIPE粗粒度二值奖励改成正样本对上的内点奖与外点罚,从而去掉负对;MegaDepth1500上AUC@5从53.47升到56.58,接弱监督LightGlue后再到59.65。

  47. S4与Mamba被证属TC0,置换合成深度须随长度增长

    William Merrill, Jackson Petty, Ashish Sabharwal · ICML 2024 · cs.LG

    NYU与Allen AI证明S4、Mamba等线性SSM和Transformer一样只能表达TC0;实验里单层RNN与输入依赖的IDS4能学任意长A5置换,S4和Mamba深度必须随序列增长。

  48. 港科大让冻结模型自己改 harness,BabyAI 进度从 42 拉到 81

    Tailin Zhou · cs.AI

    HSI 用同一冻结的 DeepSeek-V4-Flash 同时执行任务、改写任务 harness、再改写进化策略。BALROG 上相对初始 harness,BabyAI 进度从 42.0 升到 81.3,Crafter 从 11.6 升到 44.6,NLE 几乎没有提升。

  49. Baker团队把设计验证提速一个数量级,SAPP单条约24美元

    华盛顿蛋白质设计所用SAPP把阵列式表达纯化做成48小时、台面约6小时、每条约24美元;929次克隆纯度中位96%。DMX用oligo pool把基因成本再降约五倍,并筛出纳摩尔级RSV binder。

  50. 消费级健康AI正接管分诊预约配药,问责应落到整条路径

    Topol与Keane等在Nature Health指出,ChatGPT Health、Amazon、蚂蚁阿福和Claude for Healthcare正在把大模型接到病历、预约和药房。公共健康该盯平台集成深度,监管要落到路径和激励,不能只评模型。

  51. DeepMind把路由写成开盒问题,贵评估少查仍贴穷举质量

    Adam Fisch, Shubhendu Trivedi, Fantine Huot 等 8 人 · cs.AI

    DeepMind把多模型路由收成潘多拉开盒:便宜kNN默认算,贵估分只在信息价值盖过成本时才查。三套任务上regret加检查成本贴住穷举下沿,EmbedLLM平均总代价0.386对g-only的2.356。

  52. Gemini 2.5 Pro 天文奥赛理论金牌均分 85.6%,四年都进前二

    俄亥俄州立团队用 IOAA 2022–2025 共 57 题测五个模型。Gemini 2.5 Pro 理论均分 85.6%、GPT-5 84.2%,达金牌并多年排进前二;数据分析只有 GPT-5 稳住 88.5%,几何与空间推理全员弱 15–26 分。

  53. 训练从不看物体,GOAG三款灵巧手平均抓取成功率86.93%

    Julien Merand, Boris Meden, Mathieu Grossard, Liming Chen · IROS) · cs.RO

    CEA List用CVAE只在夹爪运动学上学习可行接触分布,推理时才注入物体。MultiDex上三款手平均成功率86.93%,合成整库约1个GPU小时,对照物体库要1400小时。

  54. CoToGrasp精度抓30.3%对10.5%,训练不看物体

    Julien Merand, Boris Meden, Liming Chen, Mathieu Grossard · ECCV) · cs.RO

    CEA List把物体局部特征投到夹爪规范工作空间,按Gonzalez 21类接触模板生成抓取,训练不看任何物体。DexGraspNet上精度抓成功率30.3%对Dexonomy的10.5%,拓扑合规17.18%对14.28%。

  55. 换种子晃7.7分,希腊语SFT把推理痕迹从0拉到98%

    Ayoub Kirouane, Christos Petrocheilos · cs.CL

    三家3.6–4.0B激活的前沿MoE做同一套希腊语推理SFT后,准确率几乎不动,换种子却能晃7.7分。基座0条希腊语痕迹,SFT后约98%跟问题语言走;RLVR把格式失败从24.1%压到2.5%。

  56. 谷歌DeepMind提出补丁式AGI:安全要先管智能体市场

    Nenad Tomašev, Matija Franklin, Julian Jacobs 等 5 人 · cs.AI

    谷歌DeepMind论证,通用能力更可能先从亚AGI智能体协作中浮现;为此提出四层纵深防御,核心是可隔离的虚拟智能体沙盒经济。

  57. 系统提示把声明年份改对94.6%,时态年份几乎不动

    Suze van Adrichem, Aditi Bhaskar, Diyi Yang 等 5 人 · COLM) 2026 · cs.CL

    斯坦福用时态联想与直接提问拆开「当前年份」:提示词能把声明年份改对94.6%,联想年份成功率仅1.7%,SFT与权重编辑也无法同时改两者。

  58. 3.7万小时预训练三系统VLA,人形机复杂操作成功率74%

    GigaBrain Team, Angen Ye, Axiang Sun 等 59 人 · cs.RO

    GigaBrain-0.7把理解、预测、动作拆成三系统,用3.7万小时、16种本体做单阶段预训练;后训练后Maker H01复杂操作成功率74.1%,对照π0.5的45.2%。

  59. 指定目标 Copula 后,最优传输系数 TDC 在噪声扫描中压过 Pearson 与 MIC

    Gautier Marti, Frank Nielsen, Philippe Donnat · cs.LG

    用经验 Copula 的 Wasserstein 距离度量多变量时序的内外依赖,并给出可指定目标形态的 TDC 系数;噪声扫描里它常压过 Pearson、MIC、RDC,前提是依赖形态事先写进目标 Copula。

  60. NARU:1481 道日语长视频题,开源模型总体不到 40%

    Yuheng Huang, Jianlang Chen, Jiayang Song 等 9 人 · cs.CV

    东京大学等发布 NARU:155 部共 146.8 小时日语长视频、1481 道四选题,同时考叙事追踪和读空气。Gemini-3-Flash 总体 76.2%,开源最好 39.8%;潜台词一项 Flash 掉到 57.4%。