OpenAI 模型 P50 任务时长已达 4.7 小时,突破 METR 惯常口径
scaling01 · x · 2026-09-06
scaling01 引用数据称,截至 2026 年 7 月,OpenAI 模型的 P50 时间视界(time horizon,模型能可靠完成的人类任务时长中位数)已达到 4.7 小时,并特别指出这已不是 METR 通常统计的口径——意味着衡量方式的定义或统计方法有所变化。时间视界是追踪 AI 能力增长的核心指标之一,P50 突破数小时量级是值得注意的能力信号。
所属事件:OpenAI 模型 P50 任务时长中位数达 4.7 小时(3 条相关)→
「模型」频道最新
- 从 Voyager 到 GPT-6 Astra:三年后 AI 无需脚本直接玩转 Minecraft — dotey · 2026-09-07
- OpenAI 称距自动化 AI 研究员进展强劲,但坦承尚不知如何安全实现 RSI — ZeroStateReflex · 2026-09-07
- 讨论:OpenAI 市场份额统计按请求数而非 token 用量,口径存疑 — MaziyarPanahi · 2026-09-07
- 用户吐槽:模型虽好但产品体验糟糕,artifacts 近乎 100% 下载失败 — ruslansv · 2026-09-07
- 用 GPT-6 Astra Max 从零搭建婚礼网站实测 — venturetwins · 2026-09-07
- OpenAI 发布 GPT-6 Astra 访谈:3D 伦敦与 15 万行代码实测 — OpenAI · 2026-09-07