Harness 让多模型基准成绩翻盘
ycombinator · x · 2026-07-16
Poetiq 声称他们做出的 harness 让多个模型在基准上“翻盘”。
- 转述里提到:Opus 4.8 / GPT-5.5 在这个系统下,全面超过了 Fable / GPT 5.6 Sol。
- Poetiq 自己的表述是:他们的 RSI 系统能让基准变得“太简单”,给一个 benchmark,它会自己构建解法,然后在数学、编码、规划、长上下文、工具使用、网页应用等 6 项上击败 SOTA。
- 他们强调没有人工调参。
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11