Yacine:人们只在乎软件工程基准,这是计算机科学的全面胜利
yacineMTB · x · 2026-09-29
Yacine MTB 感慨:如今 AI 领域大家真正关心的评测几乎只剩软件工程(SWE)类基准,其他能力评测基本无人问津。他把这称为“计算机科学对整个行业的彻底胜利”——代码能力成了衡量模型进步的单一标尺。
「模型」频道最新
- 用户实测:重度使用 Opus 5.5 两天,周额度仅消耗 10% — CtrlAltDwayne · 2026-09-29
- 曝 OpenAI「dot」设备新细节:举到耳边即可对话 ChatGPT 语音 — koltregaskes · 2026-09-29
- Google 将于 11 月 17 日用 Skills 取代 Gemini Gems — mark_k · 2026-09-29
- 开源工具 Carla:本地跑 llama.cpp 造「AI 角色」的织机实验室 — max_paperclips · 2026-09-29
- 爆料称 OpenAI DevDay 新品是 Grok 机器人与 Meta Muse 的翻版 — gaganghotra_ · 2026-09-29
- 高帧率运行让 Jev 成为真正的 System 1:每次点击都传完整状态 — mathemagic1an · 2026-09-29