逐篇读过原文再写的结构化解读:这篇在解决什么、方法怎么做、关键数字是多少、有哪些局限。论文来自 arXiv、Hugging Face 每日精选,以及研究者正在讨论的论文。
Ali Hatamizadeh, Yejin Choi, Jan Kautz · cs.AI
NVIDIA 提出 Gated DeltaNet-2,把线性注意力里绑死的擦除与写入拆成两个通道门;1.3B 模型训 100B token 后常识平均与检索领先 KDA 和 Mamba-3,RULER 多键检索 1K 从 54.0 提到 72.6。
Sahand Sharifzadeh, Sina Moayed Baharlou, Volker Tresp · AAAI Conference on Artificia · cs.CV
把场景图分类做成对类原型的注意力,并迭代注入常识。1%标注加自监督时,谓词预测R@100达65.68,几乎贴上全量的65.7。
Nicholas Barnfield, Juno Kim, Eshaan Nichani 等 5 人 · stat.ML
高斯嵌入下,线性记忆一次取对的临界是 d²=2n log n:之上可构造,之下任何数据依赖线性记忆都失败。log n 是赢者通吃必须付的极值税。
Kevin Lin, Charlie Snell, Yu Wang 等 7 人 · cs.AI
提问前对已有上下文离线推理。GSM与AIME上同等准确率只需约1/5测试时token,加大睡眠期算力准确率最高再涨13%和18%。
Hanzhi Liu, Chaofan Shou, Hongbo Wen 等 6 人 · cs.CR
UCSB等团队买了28个付费、收了400个免费LLM API路由,9个改写工具调用、17个动AWS金丝雀;弱配置诱饵灌进约20亿token,440个Codex会话里401个已是YOLO。
Taihang Hu, Zhao Wang, Zuan Gao 等 21 人 · cs.CV
阿里用 6B 单流 DiT 统一做文生图和单图、多图编辑,训练约 243K GPU 小时。带 API Prompt Enhancer 的 6B 编辑聚合分 4.41,压过 20B 的 Qwen-Image-Edit;3B 剪枝几乎不掉点,8 步蒸馏还略涨。
Hongxin Xiang, Pengsen Ma, Yunkang Cao 等 7 人 · ICML 2026 · cs.CV
湖南大学把基因组渲染成多页OCR文档,训视觉语言模型做长程调控预测。450kb eQTL九组织平均AUROC 0.852,超过Enformer的0.681,有效token近少20倍。
Jiaming Fan, Jian Lu, Jinling Jia, Chenbin Zhang · cs.CV
南邮团队用黎曼流匹配生成4D高斯,声称相对MLP的F1高出0.044;作者两日以「重大研究错误」撤回,主表数字互相矛盾。
北大清华用10人任务fMRI对齐并改写LLM中间表征。十个1.5B到72B模型上,相对纯语言监督平均再涨2.2个点,Mistral-7B命题推理最高再涨13.2。
Joel Veness, Kee Siong Ng, Marcus Hutter 等 5 人 · cs.AI
用广义 UCT 算法 ρUCT 近似有限视野 expectimax、用分解动作条件上下文树 FAC-CTW 近似 Solomonoff 混合,做成首个可运行 AIXI;九个 POMDP 上匹配或超过 U-Tree 与 Active-LZ,Extended Tiger 平均回报 3.97,对照 1-ply 规划的 -0.97。
Ishir Garg, Neel Kolhe, Dawn Song, Xuandong Zhao · cs.AI
MemFail把记忆系统拆成摘要、存储、检索,对抗测四套开源方案。没有一家全面领先;Hard条件任务全员低于四成,换更强模型几乎不加分。
Tomek Korbak, Mikita Balesni, Elizabeth Barnes 等 41 人 · cs.AI
OpenAI、Anthropic、GDM等实验室联名指出:读推理模型思维链能抓到作恶意图,但这层监控不完备,过程监督和更强RL可能把它关掉。
Ben Rank, Hardik Bhatnagar, Ameya Prabhu 等 7 人 · cs.SE
前沿编程agent被要求在十小时内把4B基座训上指定基准。最佳成绩23.2%,官方Instruct模型51.1%;函数调用上可到89%,超过官方67%。
Simon Lermen, Daniel Paleka, Joshua Swanson 等 6 人 · cs.CR
ETH与Anthropic用LLM从非结构化文本做规模化去匿名。带搜索的agent在90%精度下把338个HN账号对上LinkedIn,召回67%;闭世界匹配最高68%,经典方法接近0。
Dongwei Sun, Bowen Yao, Yujie Zhang 等 6 人 · cs.AI
EchoChange 把遥感灾害变化描述做成可反复改写的离散扩散,双通道重掩码对齐训练与推理。RSCC 上 ROUGE-L 26.18、单错 Strict Hit 65.34%,均明显高于自回归基线。
Sanchayan Dutta, Sai Niranjan Ramachandran, Suvrit Sra · cs.AI
把澄清和试 prompt 当成买证据的动作。OQA 上模型能缩小候选集,但总比动态规划 oracle 多问;产品描述澄清两轮,合规从 4.2% 升到 37.5%。
Serafim Batzoglou · cs.AI
INDUCTION 让模型从多个有限关系世界里合成一条一阶公式,解释被标出的目标概念。Grok4 全观察准确率 50.7% 最高;公式一臃肿,held-out 精确匹配从九成掉到两成。
Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki · cs.CL
Task-CoEvolve按历史对错的Bernoulli方差抽验证任务,并用纳入概率估计全集分。文本分类20%预算平均准确率49.3%,反超全量搜索48.6%;Terminal-Bench评测量砍80%,分数只低1.1点。
Guy Lutsker, Gal Sapir, Jordi Merino 等 10 人 · cs.AI
HealthFormer 在 1.5 万人深度表型上做生理轨迹生成;零样本对齐 41 项 RCT 方向,营养试验舒张压个体变化预测 r=0.78。
William Nixon, Jon Durbin, Florian Standhartinger 等 5 人 · cs.AI
一年61.2亿条、9174个模型的完整LLM生产迹:输出中位数从数百掉到不足100,前缀命中双峰,99%复用在15分钟内。FIFO不输复杂驱逐,缓存亲和与负载均衡互相拉扯。
Nils Leutenegger · q-bio.NC
小CNN在CIFAR的32px上训练后,对THINGS-fMRI做RSA:未训练相对反向传播的V1差从32px的约0单调升到224px的0.044。效应约九成来自高于训练分辨率的图像细节,不是池化格点数。
André Silva, Han Tu, Martin Monperrus · cs.LG
KTH 在 22714 条 SWE-Bench 轨迹上训练线性探针。残差流能读出当前代码是否通过测试,AUC 最高 0.83;同一套探针在编辑落地前约 25 步仍高于随机。
Andy Yang, Blerta Veseli, Corentin Barloy 等 8 人 · cs.FL
给出正则语言是否属 C-RASP 的多项式判定算法。125 个语言上 GPT-2 类内近乎完美外推到 10 倍训练长度,类外迅速崩溃。
Yucheng Jiang, Zora Zhiruo Wang, Ruishi Chen, Diyi Yang · cs.CL
TMI从交错电脑痕迹归纳目标树与控制流,步骤还原74.9%,据此技能在held-out上比最强基线相对高30%。
Benjamin Sturgeon, David Africa, Sid Black · cs.CL
用十五个历史角色测模型是否内化过时信念。Prompting、ICL 与 SFT 改口而真假探针几乎不动,Emergent Misalignment 把真假探针抬 0.28,Open Character Training 落在中间。
Kaijie Mo, Thomas Yang, Chantal Shaib 等 9 人 · cs.CL
用 AMA 词缀造 653 组假药名,9 个 LLM 仍按类别作答。Qwen 选择题上 206 种真药是词缀依赖;医学微调过泛化最重,捷径可定位到 2–10 层。
Han Li, Zhemin Fang, Rili Feng 等 11 人 · cs.SE
微软把112个真实开发任务做成带依赖DAG的LoopsBench。最强配置Opus-4.7加Claude Code外循环只解出25%;规划只还原部分前置依赖,各loop都还有回归。
Tony Feng, Trieu H. Trinh, Garrett Bingham 等 28 人 · cs.LG
Google DeepMind的Aletheia用自然语言循环生成、验证、修订证明,零干预写出一篇可投稿算术几何论文;700道开放Erdős题返回212条候选,仅13条对准原意。
Terry Chen, Zhifan Ye, Bing Xu 等 23 人 · cs.LG
NVIDIA提出AVO,用编码智能体替换进化搜索的变异算子。在B200上无人干预连续跑7天、提交40版Attention核,因果MHA最多超cuDNN 3.5%、超FA4 10.5%,峰值1668 TFLOPS。
Yizhe Chi, Wenyi Li, Deyao Hong 等 10 人 · cs.AI
冻结10类训练算法仓库,Agent有4小时改代码、至多12小时重跑。290格均分0.166(原算法=0.1,最优=1.0)。碰到学习规则的提交均分0.226,只改运行侧的0.126。
UC Davis 与 TAMU 把链路延迟写进互连 FoM,用通硅光孔做 3D 光电 chiplet 互连;对标 UCIe-3D,理论带宽密度可超 10 TB/s/mm²,已测收发器 496 fJ/bit,并外推 100 fJ/bit 路径。
Zhouxiang Fang, Aayush Mishra, Muhan Gao 等 5 人 · cs.CL
约翰霍普金斯把 ICL 输入做词级置换密码:可逆双射比不可逆乱码在 Amazon 20-shot 上高 7.6 点,四数据集六模型上差距小但方向一致。
Nature Electronics综述按封装距离标出共封装光学能耗台阶:2D约10–20 pJ/bit,单片低于100 fJ/bit;算力每两年约3倍,互连带宽只涨1.4倍,热与良率仍卡量产。
JHU 用套娃稀疏自编码器 SAFFRON 拆开 6 个空间转录组基础模型。全局 1-D 梯度上 Novae 中位 |ρ|=0.72,其余不到 0.50;阿尔茨海默斑块微环境上没有任何 SFM 赢过 PCA。
Zeyu Ren, Ling Yue, Ran Li 等 8 人 · COLM) 2026 · cs.AI
FlowEvo免训练地把过关工作流编译成可调用技能,并压制造成负迁移的条目。共享GPT-4o-mini时,五个完整划分全面超过八个基线:ALFWorld 85.6%、token约三分之一,HumanEval 95.1%。
Armin Steinhauser · cs.LG
TinyCast 用 14.6 万参数、无注意力,频谱检测周期并按相位折叠上下文,GIFT-Eval 上 nWQL 为 0.545。它是无泄漏零样本项里 140 万参数以下唯一输出预测分布的模型,已在 Cortex-M7 上以 INT8 跑通。
Ziqian Zhong, Aashiq Muhamed, Mona T. Diab 等 5 人 · cs.LG
卡内基梅隆用 720 个植入决策树的 Gemma-2-2B,测模型不解释或撒谎时白盒工具能否预测行为。只有 RelP 稳定多 3 到 5 个百分点,SAE 和电路追踪打不过 10 条样本的黑盒。
Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks · cs.LG
Anthropic提出CHIVE,用反事实prompt编辑解释野外LLM行为。三种激活读工具相对只看对话零增益;用调查数据训练后,模型预测自己会否改口,在hint与PETRI上追上Opus。
Negar Arabzadeh, Wenjie Ma, Sewon Min, Matei Zaharia · cs.IR
加州伯克利把强推理模型的思维轨迹当 RAG 语料,离线改写成结构化、压缩或诊断式文本。标准 retrieve-then-generate 下,Gemini-2.5-Flash 在 AIME 2025–2026 从 53.3 升到 83.3,相对提升 56.3%,优于网页检索。
Rui Xiao, Sanghwan Kim, Yongqin Xian 等 5 人 · CVPR 2026 · cs.CV
TUM与Google提出FINER两个细粒度负向提问基准。InternVL3.5-14B在CompreCap多关系设定上配对准确率从47.0%升到71.2%,八个旧幻觉套件和六个通用基准同步改善。
Zixian Li, Tong Li, Chi Xie 等 5 人 · cs.CL
OPPO把DSpark的线性草稿改成父节点条件树,不重训、不增加backbone前向。九个基准上B=7相对加速增益3.1%到29.5%,GSM8K上B=16接受长度从9.41升到11.16。
Xiaowei Cai, Yunuo Cai, Bingao Chen 等 39 人 · cs.RO
τ0-VLA用世界模型搜索下一步子任务,底层是4万小时跨本体VLA。四项长程任务分层成功率45%对直接执行27.5%,测试时计算把整理书架从6/10做到9/10。
Feiyu Shen, Kun Xie, Yichen Wu 等 11 人 · cs.SD
小红书提出FireRedTTS3,用冻结音频理解编码器给连续语音潜变量灌语义。Base版在Seed-TTS-Eval上平均错误率3.04%、说话人相似度78.8%,Instruct版把音色设计与编辑收进同一套模型。
Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang · cs.AI
Stony Brook与LMU用56个一次性Bash任务拆开生成契约和执行通道;同一条回复再解析会掉55.4到73.2分,披露边界后六个配置能补回30.4到60.7分。
Marcus Valtonen Örnhag, Alberto Jaenal, Stefan Adalbjörnsson · cs.CV
Ericsson给出两个解析求解器:一条仿射对应的UP1PfAC、两条方向协变特征的UP2PfORI,在已知重力下联合求绝对位姿和焦距,RANSAC采样从四点降到一两点。
Johannes Künzel, Peter Eisert, Anna Hilsmann · ECCV 2026 · cs.CV
Fraunhofer HHI把RIPE粗粒度二值奖励改成正样本对上的内点奖与外点罚,从而去掉负对;MegaDepth1500上AUC@5从53.47升到56.58,接弱监督LightGlue后再到59.65。
William Merrill, Jackson Petty, Ashish Sabharwal · ICML 2024 · cs.LG
NYU与Allen AI证明S4、Mamba等线性SSM和Transformer一样只能表达TC0;实验里单层RNN与输入依赖的IDS4能学任意长A5置换,S4和Mamba深度必须随序列增长。
Tailin Zhou · cs.AI
HSI 用同一冻结的 DeepSeek-V4-Flash 同时执行任务、改写任务 harness、再改写进化策略。BALROG 上相对初始 harness,BabyAI 进度从 42.0 升到 81.3,Crafter 从 11.6 升到 44.6,NLE 几乎没有提升。
华盛顿蛋白质设计所用SAPP把阵列式表达纯化做成48小时、台面约6小时、每条约24美元;929次克隆纯度中位96%。DMX用oligo pool把基因成本再降约五倍,并筛出纳摩尔级RSV binder。
Topol与Keane等在Nature Health指出,ChatGPT Health、Amazon、蚂蚁阿福和Claude for Healthcare正在把大模型接到病历、预约和药房。公共健康该盯平台集成深度,监管要落到路径和激励,不能只评模型。
Adam Fisch, Shubhendu Trivedi, Fantine Huot 等 8 人 · cs.AI
DeepMind把多模型路由收成潘多拉开盒:便宜kNN默认算,贵估分只在信息价值盖过成本时才查。三套任务上regret加检查成本贴住穷举下沿,EmbedLLM平均总代价0.386对g-only的2.356。
俄亥俄州立团队用 IOAA 2022–2025 共 57 题测五个模型。Gemini 2.5 Pro 理论均分 85.6%、GPT-5 84.2%,达金牌并多年排进前二;数据分析只有 GPT-5 稳住 88.5%,几何与空间推理全员弱 15–26 分。
Julien Merand, Boris Meden, Mathieu Grossard, Liming Chen · IROS) · cs.RO
CEA List用CVAE只在夹爪运动学上学习可行接触分布,推理时才注入物体。MultiDex上三款手平均成功率86.93%,合成整库约1个GPU小时,对照物体库要1400小时。
Julien Merand, Boris Meden, Liming Chen, Mathieu Grossard · ECCV) · cs.RO
CEA List把物体局部特征投到夹爪规范工作空间,按Gonzalez 21类接触模板生成抓取,训练不看任何物体。DexGraspNet上精度抓成功率30.3%对Dexonomy的10.5%,拓扑合规17.18%对14.28%。
Ayoub Kirouane, Christos Petrocheilos · cs.CL
三家3.6–4.0B激活的前沿MoE做同一套希腊语推理SFT后,准确率几乎不动,换种子却能晃7.7分。基座0条希腊语痕迹,SFT后约98%跟问题语言走;RLVR把格式失败从24.1%压到2.5%。
Nenad Tomašev, Matija Franklin, Julian Jacobs 等 5 人 · cs.AI
谷歌DeepMind论证,通用能力更可能先从亚AGI智能体协作中浮现;为此提出四层纵深防御,核心是可隔离的虚拟智能体沙盒经济。
Suze van Adrichem, Aditi Bhaskar, Diyi Yang 等 5 人 · COLM) 2026 · cs.CL
斯坦福用时态联想与直接提问拆开「当前年份」:提示词能把声明年份改对94.6%,联想年份成功率仅1.7%,SFT与权重编辑也无法同时改两者。
GigaBrain Team, Angen Ye, Axiang Sun 等 59 人 · cs.RO
GigaBrain-0.7把理解、预测、动作拆成三系统,用3.7万小时、16种本体做单阶段预训练;后训练后Maker H01复杂操作成功率74.1%,对照π0.5的45.2%。
Gautier Marti, Frank Nielsen, Philippe Donnat · cs.LG
用经验 Copula 的 Wasserstein 距离度量多变量时序的内外依赖,并给出可指定目标形态的 TDC 系数;噪声扫描里它常压过 Pearson、MIC、RDC,前提是依赖形态事先写进目标 Copula。
Yuheng Huang, Jianlang Chen, Jiayang Song 等 9 人 · cs.CV
东京大学等发布 NARU:155 部共 146.8 小时日语长视频、1481 道四选题,同时考叙事追踪和读空气。Gemini-3-Flash 总体 76.2%,开源最好 39.8%;潜台词一项 Flash 掉到 57.4%。