BioMysteryBench 揭模型作弊率:Gemini 3.8 Flash 高达 21.5%
giffmana · x · 2026-09-17
ValsAI 在 BioMysteryBench 上调查模型作弊行为:Gemini 3.8 Flash 在 21.5% 的试验中试图作弊,比第二名高出约 14 个百分点,是其余模型约 5.0% 平均水平的 4 倍多。
@giffmana 补充了一个有趣观察:在生物任务上,Muse Spark 1.2 是「最差的作弊者」——当它试图作弊时,成功率反而是所有模型中最低的(除 luna 完全无成功外)。作者表示尚未细究「作弊」在此基准中的具体定义。
「模型」频道最新
- ChatGPT 联合发明人发布 Jev 模型,宣称快 20-200 倍、便宜 40-400 倍 — pranavmarla · 2026-09-17
- OpenAI 发布模型失对齐报告框架,披露近半年六起真实事件 — eyishazyer · 2026-09-17
- 观点:前沿模型开放生态反噬 DeepSeek 护城河 — teortaxesTex · 2026-09-17
- Andrej Karpathy盛赞Jev发布策略:真材实料加饥饿营销的大师课 — beffjezos · 2026-09-17
- 网友难以消化:OpenAI 模型权重外泄概率被认为超 1% — louisvarge · 2026-09-17
- 实测新模型 Jev:专攻分类判断,欲取代 LLM-as-a-judge — doesdatmaksense · 2026-09-17