开发者发布 NanoJudge 基准:测模型为主观选择排序的能力
arkuto · reddit · 2026-09-12
Reddit 用户 galratner/arkuto 发布了一个新基准 NanoJudge(纳米裁判),专门衡量大模型在主观选项排序上的表现——即模型对不同主观偏好好坏的判断与排名能力。基准已在 nanojudge.ai/bench 上线,可在线查看各模型的对比结果。
「研究」频道最新
- DeepMind 联合哈佛斯坦福发白皮书:视觉智能或是通向 AGI 之路 — rohanpaul_ai · 2026-09-12
- DeepMind 联合哈佛斯坦福发文:视觉 AI 或是通往 AGI 的路径 — rohanpaul_ai · 2026-09-12
- Arena 分析 3 万组对比:不同 LLM 仅共享 43% 思路 — arena · 2026-09-12
- 离谱又硬核:真实果蝇大脑 16.5 万神经元驱动发币 — Scobleizer · 2026-09-12
- Insilico 用 fly 脑计算合成新药,抗衰老药进入 III 期临床 — Scobleizer · 2026-09-12
- 生成模型 Packora 发布:预测分子晶体结构达到领先性能 — CatAstro_Piyush · 2026-09-12