斯坦福发布 PhilosophyBench:首个独立大规模 AI 哲学能力基准
simonguozirui · x · 2026-09-25
- 斯坦福 AI Lab 与 Stanford HCI 团队推出 PhilosophyBench,宣称是首个独立、大规模评估 AI 哲学能力的基准。
- 项目由哲学家/律师/计算机科学博士 Michael Cheng 领导的跨学科团队执行,目前正招募哲学专业的学生与教师参与。
- 该基准瞄准前沿 LLM,测试其在哲学层面的推理与判断能力,团队公开了参与入口与项目页面。
所属事件:斯坦福发布首个大规模 AI 哲学能力评测基准(3 条相关)→
「研究」频道最新
- DARLING:在线 RL 中同时优化回复质量与多样性 — DanielKhashabi · 2026-09-25
- TTIC 成立 LEIF 实验室,用形式语言理论拆解 Transformer 表达力 — lambdaviking · 2026-09-25
- 研究者一作 4 篇论文中选 NeurIPS,含一篇 Oral — abeirami · 2026-09-25
- 免校准量化方法 TQ 开源:4-bit 量化 Qwen3.8-27B 即发即用 — textclf · 2026-09-25
- Yoav Goldberg:LLM 推理链强得反常,难以解释其如何从 RL 中涌现 — yoavgo · 2026-09-25
- Astral Codex Ten 长文剖析「神经语递归」:OpenAI 首席科学家的解释能打几分 — Astral Codex Ten · 2026-09-25