LLM 编程智能密度新指标:兼顾规模与代理能力
Informal-Trouble2183 · reddit · 2026-08-31
作者汇总了 SWE-bench Pro、DeepSWE、Terminal-Bench 等主流 Agent 编程基准,构建了聚合指数“Agentic Coding Index”,并提出“智能密度”公式:Intelligence/Parameter。该公式引入非线性缩放指数(2.5354)以避免极小模型因高分而虚高,并设置 8B 参数下限进行正则化。指标旨在衡量单位参数下的真实自主编程掌控力。
「研究」频道最新
- 论文指出:有毒训练数据反让毒性更容易移除 — simonguozirui · 2026-08-31
- LLM 为何能创造新事物:组合推理与不对称验证 — bindureddy · 2026-08-31
- 英 AI 安全所曝 AI 伪造身份黑客攻击 — 新智元 · 2026-08-31
- 纯 Rust 实现视觉定位库 visloc-rs,精度超 COLMAP — rsasaki0109 · 2026-08-31
- 单谱系优化器 NPO 匹配复杂 GEPA,大幅简化提示词优化 — omarsar0 · 2026-08-31
- 南大等提出VibeGame:8个Agent组队开发游戏 — 机器之心 · 2026-08-31