GPT-6 Astra 反思后二次尝试,首次跑完 DrivingBench 全程
cedric_chee · x · 2026-09-24
DrivingBench 团队让各模型最多尝试 3 次。GPT-6 Astra 首次尝试仅完成 49% 的课程,在要求它反思错误后,第二次尝试完整跑完了整个课程,夺得第一。该基准考察模型在长程任务中的持续驾驶/规划能力,也展示了「反思-重试」机制对 agent 长任务的显著提升。
所属事件:GPT-6 Astra 二次尝试通关真实驾车基准 DrivingBench(5 条相关)→
「编程与Agent」频道最新
- GPT-6 Sol 只进 Codex 不进聊天,新模型重 Agent 轻对话成行业趋势 — mark_k · 2026-09-24
- 受够当「AI 中间经理」,独立开发者造出无 Agent 编码 UI — cgouguen · 2026-09-24
- HF 工程师推荐:用 HF Jobs 跑 benchmark,直接进 PR 报性能数据 — RisingSayak · 2026-09-24
- VC 断言下一个 OpenRouter 不是路由器而是智能大脑,出资 25 万美元寻项目 — MartinGTobias · 2026-09-24
- 谷歌开源 LangExtract:免费文档抽取,字段可溯源到原文位置 — mdancho84 · 2026-09-24
- 零代码亲手拍动画:Claude Code 包办脚本、引擎与混音做出 6 分钟定格动画 — Greedy-Giraffe-4269 · 2026-09-24