Ofir Press:AI 智能体越强,找新基准越难但仍找得到
OfirPress · x · 2026-10-02
Princeton 研究者 Ofir Press 回应讨论称,正因为智能体能力很强,团队需要花费数月艰苦工作才能找到模型仍未解决的新基准;但只要智能体还不完美,就能继续构造出能区分能力的新 benchmark。
所属事件:普林斯顿研究员谈好基准三条件与基准饱和之争(3 条相关)→
「模型」频道最新
- Gemini 4 Argon 幻觉率 15%,居 AA-Omniscience 榜首 — import_jmr · 2026-10-02
- 用户实测 Opus 5.5:未见省 40% token,额度反而更快耗尽 — MarsupialFirst8617 · 2026-10-02
- llama.cpp 新增 Decision Models,本地推理迎来新玩法 — paf1138 · 2026-10-02
- 开发者试新模型 Argon:按 GPT 外部用法信任它跑,未见刷榜痕迹 — cgarciae88 · 2026-10-02
- NVIDIA 发布 Kumo-Tabular:面向结构化数据的表格基础模型 — nvidia · 2026-10-02
- Runware 上线 Claude Sonnet 5.5、Grok 4.7、GPT-6.1 Sol 三个新模型 — aziz4ai · 2026-10-02