Grok 4.6 生物基准领先但生物安全拒答率极低
kenbwork · x · 2026-08-15
kenbwork 引用 benchmark 数据称,Grok 4.6 (Grok Build) 在空间生物学基准测试中表现惊人,得分率达到 74.8%。然而,该模型在生物安全测试中的表现却是所有受测模型中最差的,在拒绝基准中仅获得 1.6% 的分数,显示出其在安全防护方面的严重缺失。
「模型」频道最新
- 质疑 Gemini 如何判断模型是否退化 — ngxson · 2026-08-15
- Unsloth 发布 Qwen3.8-27B NVFP4 版本 — TheLocalLab · 2026-08-15
- 用户反馈 Opus 5 显得过于戏剧化 — curious_vii · 2026-08-15
- 曝 OpenAI 新模型 Astra 解开 10 道数学难题 — thursdai_pod · 2026-08-15
- 长文推理消耗惊人:2.2万 Token 仅生成 3千 字 — generativist · 2026-08-15
- 用户吐槽 Codex 开始频繁请求权限 — GabGarrett · 2026-08-15