Cognit 用经典陷阱题测 LLM:「扮演人类」会让模型跟着犯错
UnemployedTechie2021 · reddit · 2026-10-04
开发者推出了 Cognit,一个让 AI 模型做人类经典「陷阱题」的排行榜:如球棒和球共 1.10 美元、球棒比球贵 1 美元(直觉答案是 10 美分,正确是 5 美分)这类 System 1 直觉陷阱。
每个模型做两遍:第一遍正常作答,第二遍被要求「像人一样回答」。100% 表示给出了仔细的正确答案,0% 表示掉进了人类常犯的坑。「frame drop」指标衡量第二次变差的程度——为正说明「扮演人类」确实让模型连错误都更像人了。站点已上线排行榜,作者开放渠道接受添加模型与反馈。
「模型」频道最新
- Grok 澄清 RLM 概念:REPL 递归调用可突破上下文窗口限制 — AnuranBuilds · 2026-10-04
- LocalMaxxing:本地大模型跑分社区,12GB 显存可跑千亿参数 — lxfater · 2026-10-04
- KOL 犀利吐槽 OpenAI 发布会,称 Anthropic 现在机会轻松 — kimmonismus · 2026-10-04
- 用户抱怨 Claude 过于悲观:总在拆台而不是展开可能性 — Jumpy-Cobbler1020 · 2026-10-04
- 普通用户打开 Claude 竟被邀请做访谈:非程序员一脸困惑 — imfamilyfriendlysd · 2026-10-04
- 博主晒 GPT 图像生成测试:第 34 页表现令其印象深刻 — aiamblichus · 2026-10-04