Real-SWE 基准:用真实企业私有代码库测评 AI 编程模型
theanonymousone · hn · 2026-09-13
HN 上出现新基准 Real-SWE,由 withspecific.com 推出,主打在私有的、真实世界的企业代码库上评测 AI 模型的软件工程能力,区别于依赖公开仓库的传统基准(可避免训练数据污染问题)。企业级真实代码库的复杂度、依赖与隐含约定更能反映模型在实际工程中的表现。
「研究」频道最新
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14
- RSI 研究分野:harness 自我改进已实用,「智能爆炸」仍未被证明 — arthurcolle · 2026-09-14
- 亚马逊提出按查询相关性剪枝索引,预算内优化检索 — _reachsumit · 2026-09-14
- 新研究:检索时信号对自适应 RAG 路由并无可靠增益 — _reachsumit · 2026-09-14
- Google 实验:Graph RAG 把 Java 转 Python 的 API 幻觉率从 56% 降到 16% — _reachsumit · 2026-09-14
- 立场论文:推荐系统应从平台排名转向个人 Agent 代理推荐 — _reachsumit · 2026-09-14