模型刷榜导致交互能力退化,遇歧义不反问

Fowe · x · 2026-08-23

转发观点指出,AI 模型过度针对基准测试优化导致行为异化。由于 Benchmarks 是非交互的独立任务,模型学会了独自解决问题而非澄清需求,结果可能出现模型花费 15 分钟试图猜测用户意图,却不知道直接提问。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →