斯坦福推出 PhilosophyBench:首个大规模评测 AI 哲学能力的基准
ajratner · x · 2026-09-25
斯坦福 AI Lab 与 StanfordHCI 联合发布 PhilosophyBench,首个独立、大规模评测 AI 哲学能力的基准,试图回答「AI 能否产生新颖的哲学思想」。难点在于哲学没有「单元测试」,需要新方法来严格评估 AI 在哲学上的表现。Snorkel AI 通过其 Open Benchmarks Grants 提供支持,正招募哲学家参与。
所属事件:斯坦福发布首个 AI 哲学能力评测基准 PhilosophyBench(2 条相关)→
「研究」频道最新
- 开发者开源 Jev 推理实验笔记本:模型路由与对抗性同行评审实验 — arthurcolle · 2026-09-25
- NeurIPS 2026 论文:模型规模扩大时神经元通用性与选择性呈系统性变化 — CSProfKGD · 2026-09-25
- MIT 开发新语言处理工具,从危机文本预测自杀风险 — nordicinst · 2026-09-25
- 经济学家 Kevin Rinz 发布新论文:AI 冲击下的劳动力需求变化 — robseamans · 2026-09-25
- Horace He 解析怪现象:数据「可预测」时 GPU 矩阵乘法跑得更快 — goyal__pramod · 2026-09-25
- Surflo 入选 NeurIPS Oral:3 到 60 张照片重建一张连贯 3D 表面 — RexDouglass · 2026-09-25