Technion 研究:泛化是稳定性而非准确率,跨数据集可逆转模型排名
Technion · hf · 2026-10-02
Technion 团队提出重新审视 LLM 泛化能力:泛化应定义为同一输入在不同表述下输出的一致性与语义稳定性,而非单一格式上的聚合准确率——后者把鲁棒性与刷分混为一谈。
核心贡献:
- 提出稳定性感知泛化目标 SAGO,在样本级、多输入变体、多行为维度(生成一致性、内部激活、置信度、响应镜像)上度量模型行为变化;
- 发现常用模型普遍存在统计显著的泛化不稳定:没有模型能均匀泛化,各行为轴捕捉相互独立的失败模式;
- 跨数据集的方差甚至可以逆转模型排名。
「研究」频道最新
- LOCI 混合空间记忆架构:流式视频世界模型复现重访场景 — IFM · 2026-10-02
- SAKIKO 审计框架揭示:行为改变不等于工具调用 LLM 的内部修复 — UniversityofBirmingham · 2026-10-02
- 学者痛批 arXiv 注水:AI 代写论文正淹没学术圈 — EhudReiter · 2026-10-02
- 做电磁学基础模型遇坑:FEM 求解器根本不在节点上算电场 — burny_tech · 2026-10-02
- AWSM:用 IMU/深度/位姿几何证据校正大模型 3D 场景重建 — anselm · 2026-10-02
- 研究:注意力非线性催生幂律 massive activation 与 scaling law — burny_tech · 2026-10-02