FrontierCode发布,Grok 4.5上榜
elonmusk · x · 2026-07-18
Cognition 发布了新的代码基准 FrontierCode,目标是衡量“真正会被合并到生产环境”的代码生成能力。这个基准强调真实可用性,公开了完整方法和样例任务,不同于很多偏合成的测试。
转推内容提到 Grok 4.5 已进入该排行榜,并希望用更贴近开发者实际工作的方式,评估模型写出的代码是否能直接落地、集成并解决真实问题。
「编程与Agent」频道最新
- 别让 AI 自造成功标准:给它可验证目标才好用 — daniel_mac8 · 2026-09-11
- 开发者观点:前沿模型需要验证自身成功的方式,否则会自行编造 — daniel_mac8 · 2026-09-11
- Sakana AI 发布 Fugu Max:动态编排开源模型池逼近精英模型性能 — graceisford · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11