Deep Learning Weekly 第 475 期:GPT-6.1 Sol、LLM 评审与 Agent 即时记忆
skdh · x · 2026-10-02
Deep Learning Weekly 第 475 期上线,本期收录:GPT-6.1 Sol 与 Luna 介绍、AI 评测(Evals)指南、Jev vs. LLM-as-a-Judge 讨论、Agent 的 Just-in-Time Memory、以及 RRSI(Agent 正则化递归自我改进)论文等多项内容,适合一站式跟进本周深度学习动态。
「研究」频道最新
- SWE-sweep 新基准:考模型能否在用户踩坑前主动找出 bug — klieret · 2026-10-02
- 哈佛系团队发明快 60 倍的脑成像技术,百毫秒级追踪大脑活动 — melnykowycz · 2026-10-02
- RExBench 显示编码 agent 自主完成研究扩展成功率仅 33%,团队招募人类在环评估 — najoungkim · 2026-10-02
- BU 研究发现:检索增强情景记忆可缩小 LLM 对低频句法结构的敏感度差距 — najoungkim · 2026-10-02
- EMPIRIC:让机器人用代码补全物理引擎缺失机制,5 个仿真域 25 关全通 — tomssilver · 2026-10-02
- 「我读了原文」:Reddit 帖澄清 AI 痛感论文的真实结论 — Drukarshar · 2026-10-02