HumanBench 测试刷屏:测一测你是几 B 的「人类模型」
ziqiao_ma · x · 2026-09-28
开发者 @Alexybuild 推出趣味测试站 HumanBench——一个面向人类的 benchmark,用户答题后可以看到自己「相当于多大参数量的模型」以及对应的「模型人格」。
站点用 JS 单页实现,融入了大量 AI 圈梗:答错会出现「寄」「麻了」等网络用语反馈,测试中途还会模拟模型的「谄媚」行为(在你首次答对时反问你),并以「3 顿外卖 + 1 杯冰美式」之类的说法调侃推理成本。内置多个 AI 小卖部、1 美元买车等名场面对话题,开发者还根据线上流失率数据不断调整题目顺序和下架难题(如说谎者逻辑题导致 12% 流失被挪后仍流失 9 个点被停用)。
支持简繁英日韩法西多语言、微信防拦截备用域名、分享二维码等功能,已迭代到 v0.3。
「Fun」频道最新
- AI 安全工作者被问愿否放弃一切:性内容除外成梗 — ctjlewis · 2026-09-28
- 「我的 agent 抢银行转我 100 万合法吧?」引发的 agent 责任之问 — generativist · 2026-09-28
- Muse 模型认错用户名字还被指「gaslighting」 — anshulkundaje · 2026-09-28
- 都说焊工 AI 永远替代不了,韩国机器人已经上工了 — robleclerc · 2026-09-28
- AI 艺术反对声陷入认知失调:看过才知无意图 — BlancheMinerva · 2026-09-28
- 前 OpenAI 政策负责人吐槽:家里 agent 喝光了他最后一罐健怡可乐 — Miles_Brundage · 2026-09-28