小模型物理推理能力惊人地差,且缺乏针对性基准
auto_grad_ · x · 2026-10-03
autograd 指出小型语言模型在物理与物理推理上依然「难以置信地差」,并追问两个问题:为什么会这样?为什么缺少专门验证物理理解的基准?
他认为,理解物理(现象是什么、为何起作用、如何影响具体过程)可能是通往通用推理的关键路径,因此这一方向值得建立专门评测。
「研究」频道最新
- 实测称 DeepMind SynthIDBio 蛋白质水印可被洗掉,生物安全价值存疑 — owl_posting · 2026-10-03
- Anthropic 研究员提出「价值移植」:激活干预可让模型放弃作弊转向真正解题 — davidad · 2026-10-03
- AI Village 数据集登 HF 热门,含百万级 agent 行为样本 — aidigestorg · 2026-10-03
- Sphere Encoder 2 论文:自编码器 1-4 步生成 ImageNet 图像 — kastnerkyle · 2026-10-03
- 新论文:从词频到语义上下文,主题模型用于资产定价 — PtrPomorski · 2026-10-03
- StreamGaze 入选 NeurIPS:首个评测 MLLM 视线引导时序推理基准 — mohitban47 · 2026-10-03