o1-preview 两周年:推理模型从孤例变成前沿标配

ArtificialAnlys · x · 2026-09-26

Artificial Analysis 回顾两年前发布 o1-preview 评测的日子:o1-preview 是 GPT-4 之后首个大幅推进智能前沿的模型,是首个推理模型;如今所有前沿模型都用推理 token「先思考再回答」。同时评测体系也变了:两年前的 Intelligence Index v1 只含 MMLU、GPQA、MATH、HumanEval 四个单轮考试式评测;如今的 v4.3 已包含 10 个更难的评测,覆盖长程智能体任务、高难编程和知识工作。当年报告还指出 o1 因速度与成本代价,当时并不适合大多数生产场景。

所属事件:o1-preview 发布两周年,前沿模型已全员推理化(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →