JevBench 作者宣布将测 OpenAI Decisions API
airesearch12 · x · 2026-09-30
JevBench 基准测试的作者回应称将尽快用该 benchmark 测试 OpenAI 新发布的 Decisions API。
「研究」频道最新
- HCOMP 论文提出「信念更新门」分离人机交互中的惰性与学习 — windx0303 · 2026-09-30
- ECMWF AI 次季节预报年度比拼,小团队模型夺冠 — LesterMackey · 2026-09-30
- 10 个 Sonnet 5.5 智能体自主研究 15 小时,产出 17895 行数学证明 — 141_1337 · 2026-09-30
- 研究者质疑:ML 会议审稿正沦为 LLM 打分,送审还有何意义 — aran_nayebi · 2026-09-30
- 提出 Reasonlet 概念:让模型边推理边搭出可复用的复合系统 — PurpleDragon99 · 2026-09-30
- 研究揭示 LLM 通病:过度自信且忽视细节,偏好学习可解 — qi2peng2 · 2026-09-30