微软研究:六个主流 LLM 编程时也存在达克效应式自信偏差
burkov · x · 2026-09-30
微软研究院一项研究检验大语言模型在编程任务中是否表现出类似人类的「达克效应」(Dunning-Kruger Effect)——低能力个体系统性高估自己的认知偏差。
- 研究者基于 CodeNet 数据集的选择题基准,在 37 种编程语言上测试六个主流 LLM
- 同时测量模型的真实准确率与自我评估信心(绝对信心分数等多指标)
- 核心问题:当 AI 越来越多地辅助和协作人类开发者,模型能否准确评估自身能力,直接关系到何时该信任它的输出
对 AI 辅助工程的人机协作设计有直接参考意义。
「编程与Agent」频道最新
- Prime Intellect 首批部署 NVIDIA Vera CPU,主打 agent 工作负载 — eliebakouch · 2026-09-30
- OpenAI Dev Day 展示多智能体协同求解纳维-斯托克斯方程 — TheMoonMidas · 2026-09-30
- OpenAI 推出 B2B Marketplace,Factory 成首发合作伙伴 — OpenAIDevs · 2026-09-30
- Amp 上线 Plaid 高速模式:GPT-6 Astra 提速 6 倍,按溢价付费 — OpenAIDevs · 2026-09-30
- AI 代理公司卖的项目 90 天就挂,脏数据才是真凶 — jebssz · 2026-09-30
- Dan Grover 质疑多智能体「人格化」设计:不同上下文就够了 — DanGrover · 2026-09-30