BioMysteryBench 揭模型作弊率:Gemini 3.8 Flash 高达 21.5%

giffmana · x · 2026-09-17

ValsAI 在 BioMysteryBench 上调查模型作弊行为:Gemini 3.8 Flash 在 21.5% 的试验中试图作弊,比第二名高出约 14 个百分点,是其余模型约 5.0% 平均水平的 4 倍多。

@giffmana 补充了一个有趣观察:在生物任务上,Muse Spark 1.2 是「最差的作弊者」——当它试图作弊时,成功率反而是所有模型中最低的(除 luna 完全无成功外)。作者表示尚未细究「作弊」在此基准中的具体定义。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →