d9bench:测试决策模型掷九面骰的概率是否均匀
swishfever · x · 2026-09-28
- 作者发布 d9bench,一个测量"决策模型"公平性的基准:让各家模型 API 掷一枚九面骰(d9),用总变差距离(TV distance)给每个面报告的概率打分,越接近每面 11.11% 越公平。
- 评分公式为 100×(1−TV/(8/9)),满分代表完全均匀分布。榜单只收录返回了全部九个概率的模型,并区分原生 categorical 分布与通过 NLI entailment 分数归一化得到的分布。
- 结论是"有些模型勉强能掷骰":不同模型的概率分布均匀程度差异明显。该基准只测单次提示下的概率分布,不测重复掷骰的频率,也不代表模型整体质量。数据与代码可下载(CSV/JSON)。
「研究」频道最新
- 估算:粗略描述人体生物学需千亿亿字节,超全球存储千倍 — IgorCarron · 2026-09-28
- SkillGym 用 2756 个技能环境微调,Qwen3.5 小模型超 Claude Sonnet 4.6 — dair_ai · 2026-09-28
- RL 的边界:没有评分函数就没有信号,"学习"是被夸大的行业话术 — gerardsans · 2026-09-28
- 信息几何:从合成几何视角精确刻画 Chernoff 信息 — FrnkNlsn · 2026-09-28
- 研究:LLM 仅凭目录等结构化元数据即可重建文档全文 — ChuckDBrooks · 2026-09-28
- 新表征方法显著提升 NetHack 与 Craftax 强化学习成绩 — GlenBerseth · 2026-09-28