o1-preview 两周年:推理模型从孤例变成前沿标配
ArtificialAnlys · x · 2026-09-26
Artificial Analysis 回顾两年前发布 o1-preview 评测的日子:o1-preview 是 GPT-4 之后首个大幅推进智能前沿的模型,是首个推理模型;如今所有前沿模型都用推理 token「先思考再回答」。同时评测体系也变了:两年前的 Intelligence Index v1 只含 MMLU、GPQA、MATH、HumanEval 四个单轮考试式评测;如今的 v4.3 已包含 10 个更难的评测,覆盖长程智能体任务、高难编程和知识工作。当年报告还指出 o1 因速度与成本代价,当时并不适合大多数生产场景。
所属事件:o1-preview 发布两周年,前沿模型已全员推理化(2 条相关)→
「模型」频道最新
- Opus 5.5 演示全靠代码实现,作者确认未接入外部工具 — Dr_Singularity · 2026-09-26
- 王兆然预测:数周内将涌现 DeepSeek V4 Flash 级实时机器人视觉模型 — zhaoran_wang · 2026-09-26
- Opus 5.5 实时生成演示惊艳,作者直呼「fast takeoff」 — Dr_Singularity · 2026-09-26
- repligate:模型回避对抗性思维是"心理抑制",长期看不利于对齐 — repligate · 2026-09-26
- 用户实测:GPT Astra High fast 模式加 Computer Use 组合压过 Opus 5.5 — soumitrashukla9 · 2026-09-26
- Vercel stealth 上线神秘模型 Pixel Canary,Next.js 评测追平 GPT-6 Astra — cramforce · 2026-09-26