RL 环境只爬单一山峰,模型各擅其长需多模型互补
dejavucoder · x · 2026-09-05
网友 dejavucoder 观察指出,各实验室选择的 RL 训练环境会让模型在特定能力上出现「尖峰」(spikes),因此要评估模型的综合/泛化能力,只能拿多个模型各取所长拼出一个近似画像。他因此期待 Grok 4.7 能带来一些独特的尖峰,补充整体图景。
「模型」频道最新
- 用户吐槽 GPT-6 各端可用性混乱:Chat 有 Pro 版,Codex 却没有 — justalexoki · 2026-09-05
- 网友让 Astra 生成同时满足时空对称性的动画 — yaroslavvb · 2026-09-05
- 3D 艺术家实测 GPT-6:一个 prompt 组装整车并做动画 — petewoodbridge · 2026-09-05
- 同题横评:Ministral 14B 与 Qwen3.8-27B 表格查询全对,Gemma 4 幻觉翻车 — andrejusb · 2026-09-05
- Astra 计算机使用实测:五分钟才完成一步,与宣传差距大 — bubu19999 · 2026-09-05
- GPT 6 Astra 上手首日:速度快、懂 skills、找 bug 强 — cneuralnetwork · 2026-09-05