前沿模型构建agent仍是显著短板

多位开发者指出,当前前沿模型虽然在通用任务上表现强劲,但在构建其他 agent 或 harness(工具套件)这类前沿任务上仍存在显著困难,这是模型能力的明显短板。评估方面,建议关注尚未饱和的基准测试,如 Frontierswe、Mirrocode、Posttrainbench 和 Agents Leaderboard 等,这些榜单更能揭示模型的真实局限。

2026-08-23 ~ 2026-08-23 · 3 条相关