HarnessEval-W 发布:用子智能体让世界模型评测可审计
_akhaliq · x · 2026-08-18
新基准 HarnessEval-W 将 harness 范式引入视觉世界模型评测:由专门的子智能体为每一个打分生成透明、可审计的推理链,让世界模型的评估过程本身也可以被检查和追责。
所属事件:HarnessEval-W:分层子 Agent 分解视觉世界评估(2 条相关)→
「研究」频道最新
- RL2-VLA:视觉语言动作模型的自适应 RL 组合转向与测试时扩展 — rsasaki0109 · 2026-08-18
- MIT 新模型 SparksMatter 自主发现无毒热电材料 — ProfBuehlerMIT · 2026-08-18
- 实战微调 0.8B 模型优化本地语音转文字后处理 — MoodOdd9657 · 2026-08-18
- 普林斯顿学者详解:LLM 无失真水印为何可能,多数人误解了生成机制 — soumitrashukla9 · 2026-08-18
- VibeWorlding 基准:开源 30B 模型在 3D 世界构建中胜出 — Justgototheeffinmoon · 2026-08-18
- 新论文提出最优控制变量法,用于调查抽样和因果推断的方差缩减 — RexDouglass · 2026-08-18