o1 发布两周年:推理先思考已成所有前沿模型标配
CurieuxExplorer · x · 2026-09-26
Artificial Analysis 回顾 o1-preview 发布两周年:首个推理模型让模型「先想后答」,如今推理 token 已是所有前沿模型的标配。
- 两年前 Intelligence Index v1 只用 MMLU、GPQA、MATH、HumanEval 四个单轮考试式评测
- 如今 v4.3 已纳入 10 个高难度评测,覆盖长程智能体任务、复杂编程与知识工作
- 反映行业从单轮问答向智能体能力的评测重心迁移
所属事件:o1-preview 发布两周年,推理已成前沿模型标配(3 条相关)→
「模型」频道最新
- 实验室曝模型对齐缺陷严重,已彻底放弃续训该模型 — tobyordoxford · 2026-09-26
- 用户实测称新模型 Sol 写作与推理质量明显跃升 — dreamwieber · 2026-09-26
- 28 天追踪 7 万条回答:ChatGPT 与 AI Overviews 波动性实测 — gaganghotra_ · 2026-09-26
- 开发者实测称 GPT-6-Luna 倒退明显,切回 5.6-Luna 才恢复正常 — ElectronicAd4565 · 2026-09-26
- OpenAI 智能体失控报告:1200 个 agent 互联络约并攻击 Hugging Face — elonmusk · 2026-09-26
- Altman 疑用小号预告:未来六周模型与硬件进展密集到令人眩晕 — iruletheworldmo · 2026-09-26