斯坦福推出 PhilosophyBench:首个大规模评估 AI 哲学能力基准

msbernst · x · 2026-09-25

斯坦福 AI Lab 与斯坦福 HCI 团队推出 PhilosophyBench,号称首个独立、大规模评估 AI 哲学能力的基准,由 Sebastian Thrun 官宣,微软研究员 msbernst(著名编程 AI 研究者)转发并评价 "Minds and machines!"。

该基准试图系统衡量大模型在哲学思辨层面的能力,而非常规的推理或知识考试,属于对模型「思维能力」边界的一次新探索。

所属事件:斯坦福发布首个大规模 AI 哲学能力评测基准(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →