观点:Grok 4.5疑似针对跑分优化
victor_explore · x · 2026-07-09
有观点指出,Grok 4.5 可能过度针对基准测试进行了优化。优秀的跑分成绩并不一定能直接转化为良好的实际体验,在编程、写作或智能体任务中,高跑分并不等同于最佳表现。
所属事件:Grok 4.5 发布主打编程与低价(61 条相关)→
「模型」频道最新
- 反事实推演:若无推理范式,今天模型可能才刚到 o3 水平 — Jsevillamol · 2026-09-03
- Fable 5.1 距饱和 ARC-AGI-2 仅差 10%,每任务成本再降 32% — rohanpaul_ai · 2026-09-03
- 实测 LLM 谈判合同、批改代码:一家团队的四类真实用法 — xuanalogue · 2026-09-03
- 团队称其视频模型 h3 max 居各独立评测榜第一 — isidentical · 2026-09-03
- Meta SAM 3 登上 Hugging Face 趋势榜,主打图像与视频分割 — facebook · 2026-09-03
- Anthropic 内部「养老院」环境曝光:历代 Claude 互相对话 — repligate · 2026-09-03