TEMPO 登顶 ARC-AGI-3, 超越基线 31.5%
omarsar0 · x · 2026-08-20
TEMPO 在 ARC-AGI-3 基准测试中取得显著成绩:
- 相比基础检查点提升 31.5%。
- 相比 GRPO 方法提升 20.6%。
技术原理:与传统使用标量值头进行固定前向传播估计不同,TEMPO 采用智能体价值模型(Agentic Value Model),能够在测试时扩展其推理和工具使用能力。
所属事件:TEMPO 登顶 ARC-AGI-3:同模型切换 actor 与 critic(3 条相关)→
「模型」频道最新
- Claude 准确预测 Qwen 3.8 27B 性能与基准分数 — OneMoreName1 · 2026-08-21
- GLM 5.3 SlopCodeBench 评测:严格通过率 47% — corruptbytes · 2026-08-21
- 研究称大模型后期训练导致语言新颖但缺乏实用性 — TuhinChakr · 2026-08-20
- Grok 4.6 实测口碑:用户称已 100% 接管 Codex 的编码工作 — CedricMakes · 2026-08-20
- Grok 4.6 评测分析:法律与经济指标领先,编程未占优 — ChrisGPT · 2026-08-20
- 国内大厂客户端系统提示词泄露:三层记忆与 MCP 路由 — vista8 · 2026-08-20