别盲信跑分:专家警告大模型评测工具差异会严重扭曲成绩

cedric_chee · x · 2026-08-03

作者指出,尽管各大厂商发布的 Benchmark 跑分表看起来很全面,但其评测方法往往不够透明。详细的脚注表明,跨模型的分数对比应当谨慎对待。

核心问题在于,不同的评测工具(harness)即使测试同一个模型,也会因为环境与实现差异,对 Agentic(智能体)基准测试得分产生实质性影响,而这种差异与模型本身的真实质量无关。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →