LLM 编程智能密度新指标:兼顾规模与代理能力

Informal-Trouble2183 · reddit · 2026-08-31

作者汇总了 SWE-bench Pro、DeepSWE、Terminal-Bench 等主流 Agent 编程基准,构建了聚合指数“Agentic Coding Index”,并提出“智能密度”公式:Intelligence/Parameter。该公式引入非线性缩放指数(2.5354)以避免极小模型因高分而虚高,并设置 8B 参数下限进行正则化。指标旨在衡量单位参数下的真实自主编程掌控力。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →