SimpleBench 前沿模型平均分首超人类基线

SimpleBench 是专为测试大模型长期薄弱、人类相对擅长的推理能力设计的基准,涵盖常识推理、空间与时间推理、社会判断以及针对浅层模式匹配和误导性假设的陷阱题。最新成绩显示,前沿模型的平均分首次越过人类基线,引发网友热议,有人据此称「AI 机器人比人类更有常识」,甚至以「人类末日到了」调侃,认为 AI 在常识推理上已超越人类。

2026-09-06 ~ 2026-09-07 · 2 条相关