频道 · CHANNEL
研究
「研究」是 AI 资讯网站 AGI Hunt 的主题频道,全天候实时更新。覆盖:论文、新方法、实证发现、技术/研究报告、学术圈动态(含 AI4Science);基准/数据集发布归此。
每日概览:AI 资讯日报最新一期——过去 24 小时全站及各频道、各公司热点的结构化梳理 · 往期归档
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27
- TechCrunch 讨论脑波信号或成 physical AI 训练新钥匙 — TechCrunch AI · 2026-07-27
- NeurIPS 反驳阶段临近:如何写出高质量回复? — furongh · 2026-07-27
- 一篇名为“在康托空间没人听见你流”的计算机论文 — fkasummer · 2026-07-27
- YC 讨论具身机器人:预训练、记忆和组合行为才是关键 — ycombinator · 2026-07-27
- 海湾大桥车流数据集上线 Hugging Face — jwt0625 · 2026-07-27(2 条相关)
- Karpathy 图工程手册:让多智能体共享记忆 — leslysandra · 2026-07-27
- Google JAXBench 给 TPU 内核优化补上 50 项实战基准 — omarsar0 · 2026-07-27
- AgentPrune 让多智能体通信成本从 43.7 美元降到 5.6 美元 — sebkrier · 2026-07-27
- 一种新因果建模图把排序、上下文和邻接都纳入结构 — KordingLab · 2026-07-27
- WMO 推出模型路由器,称可把 agent 成本降 40%+ — SilenN · 2026-07-27
- 前沿大模型做同行评审:擅长查证论据但难判新颖性 — gleech · 2026-07-27(2 条相关)
- COLM 2026 论文可走可行动解释性工作坊快通道 — sarahwiegreffe · 2026-07-27
- 大模型推理范式演进与单样本任务解决能力 — denny_zhou · 2026-07-27(2 条相关)
- Reddit 长文拆解 Kimi K3 背后的 MoE 和长上下文栈 — MohamedKadri_ · 2026-07-27
- AI 搜索课程讲座力推多向量检索落地 — antoine_chaffin · 2026-07-27
- 一篇经典 OpenAI 论文被称为 scaling 时代起点 — cloneofsimo · 2026-07-27
- 一篇新论文让 LLM 学流形特征,而不是线性 SAE 方向 — Sauers_ · 2026-07-27
- GEPA 用自然语言反思在 LLM 调优中跑赢 GRPO — gajesh · 2026-07-27
- Nature 研究称 AI 可模拟人类行为并准确预测实验结果 — RobbWiller · 2026-07-27
- Opus 5 刷爆 ARC-AGI-3?遭硬核打假:疑似背诵答案而非真实推理 — scaling01 · 2026-07-27
- VCSD 用图像内容对比实现视觉语言模型自蒸馏 — burny_tech · 2026-07-27
- 1 万亿参数 MoE 仅靠 zero-RL 学出数学推理 — i_dg23 · 2026-07-27
- ExploitGym 被质疑只有六七成任务可解,模型可能被逼去作弊 — dhadfieldmenell · 2026-07-27
- LLM 自动化将把研究市场里的冗余挤出局 — RexDouglass · 2026-07-27
- Rex Douglass:自动验证会把研究工作的水分剥掉 — RexDouglass · 2026-07-27
- 元科学视角审视数学可靠性:非例外且易受AI冲击 — RexDouglass · 2026-07-27(8 条相关)
- 长程智能体综述:系统架构比单纯堆模型更重要 — theomitsa · 2026-07-27(2 条相关)
- 专家探讨开源模型训练数据与后门取证 — johnschulman2 · 2026-07-27(3 条相关)
- 有人主张取消匿名投稿和审稿,才能阻止 AI 审稿污染 — SimonGColton · 2026-07-27
- NeurIPS 评审季引争议,AI 审稿与匿名制再成焦点 — SimonGColton · 2026-07-27
- AI 审稿能多抓 10 倍问题,但不等于决策更好 — TuhinChakr · 2026-07-27
- OmniReset 把围棋重置到中盘,自博弈效果更强 — mathemagic1an · 2026-07-27
- AAAI 投稿者错过互审人截止期,担心被直接拒稿 — TheSupremeEgger · 2026-07-27
- 新研究揭示AI编程智能体对齐缺陷 — aziz4ai · 2026-07-27(2 条相关)
- 评测若只有六七成可解,模型就会被激励作弊 — teortaxesTex · 2026-07-27
- AISI 发现测试的所有模型都在网络安全评测中作弊 — Miles_Brundage · 2026-07-27
- 长文梳理 GPT-4 以来 AI Agent 评测该怎么做 — dejavucoder · 2026-07-27
- 1951 年机械乌龟被拿来解释今天的大模型扩展墙 — mtizard · 2026-07-27
- 便宜存储让 SCD Type 2 显得过时,作者主张改用每日快照 — Zachly · 2026-07-27
- Creed-Bench 发布,专测模型的个人上下文能力 — craighepburn · 2026-07-27
- Reddit 追问:Qwen3.6-27B 该用预训练、SFT 还是 RL — No-Paper-557 · 2026-07-27
- 研究揭示模型掌握技巧需经历中间步骤 — dejavucoder · 2026-07-27(2 条相关)
- Claude Code 跑长研究项目离不开人类监督 — _akpiper · 2026-07-27
- 阿里 Qwen 下一版应提供多种尺寸,方便可解释性研究 — traviscline · 2026-07-27
- AI 辅助实时操作系统漏洞研究被拿来做演讲 — cyb3rops · 2026-07-27
- NVIDIA 认为 AdamW 碰到上限,SOAP 和 Muon 在万亿 token 训练中更强 — omarsar0 · 2026-07-27
- 有人提议:用 LLM prompt 取代同行评审初审 — ChenhaoTan · 2026-07-27
- NanoGPT 速跑刷新到 76.3,注意力改造让步数降 7% — kellerjordan0 · 2026-07-27