开发者热议:现有 benchmark 几乎不测模型「行为好不好」

willcb · x · 2026-09-24

一场关于 AI 评测盲区的讨论。有开发者表示,自己越来越不在意「模型够不够聪明」,而是更关心「模型行为好不好」(does the model behave well)——但现有 benchmark 几乎没有试图捕捉这一点。

讨论指出当前评测体系的结构性缺口:能力分数可以被刷,但行为质量(如配合度、稳定性、边界感)缺乏可量化的测量手段,这已成为一线使用者的真实痛点。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →