PAWBench实测:给定目标结果,视频模型仅38–58%概率生成
RisingSayak · x · 2026-08-28
PAWBench 线程的关键实验结果:作者尝试三种修复——更清晰的结果指令、更多样的采样、额外训练——每种各解决一部分问题,但没有一种能端到端修复。即使明确告诉模型期望的结果,它也只在 38–58% 的情况下生成该结果。此外模型会对错误的信号起反应:改变真实物理时预测变化太小,改变无关视觉/文本线索时变化反而过大。
所属事件:PAWBench 揭示视频生成模型缺乏概率对齐能力(5 条相关)→
「研究」频道最新
- 研究:任务多样性抑制持续强化学习 — RubenEVillegas · 2026-08-28
- 数学家质疑 Astra 非可解群证明:只是既有定理的变形? — badumtsssst · 2026-08-28
- AI 重构天文观测:揭示星系等离子体喷流物理细节 — bravo_abad · 2026-08-28
- 图灵研究所展示 AI 气象预报最新成果 — turinginst · 2026-08-28
- OpenDDE-harness 9 月 10 日发布,单提示词设计抗体 — AllThingsApx · 2026-08-28
- Hot Take:未经人工校准的 LLM 评分非真实评估 — bgoncalves · 2026-08-28