deception-bench 得 0 分意味着测试失效,已无可测之物
MoonL88537 · x · 2026-09-04
MoonL88537 对自己上一条帖子(deception-bench 得 0 分是坏事)的补充:如果模型在该基准上得 0 分,说明「你已经什么都没在测了,这个测试是无用的」——强调该基准的低分不能解读为模型安全,而更可能意味着评测机制失效。
所属事件:deception-bench 得 0 分被指意味着测试失效(2 条相关)→
「模型」频道最新
- OpenAI 称 GPT-6 Astra 越过网络安全关键阈值,收紧部署管控 — bigdata · 2026-09-04
- 单台 DGX Spark 跑 Qwen3.8 Flash NVFP4:1M 上下文实测方案 — BLUECOW009 · 2026-09-04
- Ollama CEO:开源模型用量年内暴涨150倍,85%财富500强在用 — ycombinator · 2026-09-04
- Gemini 团队回应近千条用户反馈:正认真分析意见 — patloeber · 2026-09-04
- kuza55:ARC-AGI-3 已在无独立符号系统下被解决 — kuza55 · 2026-09-04
- c_valenzuelab:视频世界模型规模化+实时推理=可交互世界模拟 — c_valenzuelab · 2026-09-04