GPT-6 Astra 评测分化:更像计算机使用专用模型而非 AGI

becomingengageably · reddit · 2026-09-04

一位 Reddit 用户综合 OpenAI 官方发布材料、Claire Vo 的早期试用与 Artificial Analysis 的独立评测,对 GPT-6 Astra 得出判断:与其争论「是不是 AGI」,不如把它当作计算机使用(computer-use)智能体模型来评估。

关键数据点:

作者的结论是:Astra 更适合「更强计算机使用/编码/长上下文、更少失败重试能溢价买单」的专业工作流,而非通用替代。他建议的实测方法:选一个昂贵碎片化的工作流,与现有模型并跑,度量完成率、被接受的产出、重试与纠错时间、总成本,重要操作保留人工审批,最终按「每个被接受结果的成本」决策,而非只看发布榜。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →