MoralityBench 榜单:AI 的道德判断跨次运行波动大,并非确定性输出
NakedPlato · reddit · 2026-10-05
新上线的 MoralityBench.ai 把道德心理学测试改编成 AI 基准,生成一个「AI 道德排行榜」。发布者指出一个有趣的发现:除 Jev 外,各模型在多次运行中对同一道德问题的回答存在明显方差——道德判断似乎不是确定性的。站点已公开榜单,配图展示了各模型的对比结果。
「模型」频道最新
- NSA 建议静默降级疑似蒸馏用户,与 Anthropic 六月透明承诺相抵 — MysteriousAvocado580 · 2026-10-05
- 用户实测:Opus 5.5 在 Hermes 中体验优于 Grok Bot 和 Dots — EXM7777 · 2026-10-05
- 网友惊叹 Fable 5.5 无需搜索即可对答冷门历史与 X 用户知识 — ChrisGPT · 2026-10-05
- 2.6B 竟胜 2B:LFM2.5 速度更快、内存省 1.3GB 实测对比 MiniCPM5 — parepeg · 2026-10-05
- 直播:GPT-6 Astra 对战最强星际争霸 Bot Pluto — philipvollet · 2026-10-05
- 网友:中国靠蒸馏开源顶级模型,美国用订阅锁住最好 AI — LazyPotatoHead97 · 2026-10-05