开发者实测:基准 evals 靠不住,但 Astra 首次越过信任阈值

sandersted · x · 2026-09-04

一位开发者分享对 gpt-6 Astra 的使用观感:不要迷信评测基准——它们往往粗糙、测不到真正重要的东西,比如「主动澄清问题」这类在真实使用中有益的行为反而可能拉低分数。但他认为 Astra 是真材实料:虽不完美,却是第一个越过他个人信任阈值的模型。这是对新一代模型实际可用性的第一手用户反馈。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →