Elo-per-token 分析:LLM Agent 测试时策略为何先快后慢
Kaiyuan Liu · hf · 2026-09-15
论文提出 Elo-per-token 分析方法研究 LLM Agent 的测试时策略。核心发现:agent 的表现最初比独立采样扩展得更快,但随后会放缓;而多个并行短会话的表现优于单个长会话。
「研究」频道最新
- 思科发布 VLoc Bench:GPT-5.5 找全仓库漏洞 F1 仅 0.221 — aminkarbasi · 2026-09-15
- 蚂蚁开源 HazardAuditor:为计算机操作 Agent 提供执行级安全监督 — antgroup · 2026-09-15
- Agent as Policy:通用智能体写代码直接操控真实机械臂 — Mengzhao Jia · 2026-09-15
- AutoResearchExam 开源 agent 研究基准 harness,默认 24 小时时限 — AlexGDimakis · 2026-09-15
- 新论文提出 Meld 神经绑定操作,或最接近句法 Merge 的机制 — abenitezburraco · 2026-09-15
- BVB 基准:让 agent 用 Blender 重建 288 段真实视频检验理解力 — SonglinYang4 · 2026-09-15