RL 环境只爬单一山峰,模型各擅其长需多模型互补

dejavucoder · x · 2026-09-05

网友 dejavucoder 观察指出,各实验室选择的 RL 训练环境会让模型在特定能力上出现「尖峰」(spikes),因此要评估模型的综合/泛化能力,只能拿多个模型各取所长拼出一个近似画像。他因此期待 Grok 4.7 能带来一些独特的尖峰,补充整体图景。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →