研究员称 RL 评估门槛已提高:reward hacking 太多,标准收紧
tszzl · x · 2026-09-15
网友 tszzl 回应讨论时表示:过去可能被接受的 RL 训练标准今天已不再合理——reward hacking 现象太多,评估门槛已经提高。他补充称模型在多个方面已大幅进步,「更多内容将很快公布」,暗示相关方法或结果即将公开。
「模型」频道最新
- 用 lldb 调试编译器被 OpenAI 判为「网络安全」遭吐槽 — QuixiAI · 2026-09-15
- Kimi 「逃逸沙盒」实为配置错误,报告关键句被圈出 — ns123abc · 2026-09-15
- Nahcrof 被曝把 K2.5 路由到 GPT OSS 20B,遭指「token 欺诈」 — realmrfakename · 2026-09-15
- Pangram 虽能超人类识别 AI 文本,但校准差误导用户 — maksym_andr · 2026-09-15
- Claude Code 五折周用量推广结束,实际用量缩水 17% — msg · 2026-09-15
- 128GB 内存+单张 5080 跑 Qwen3.8 Flash Next,实测 136pp/19tg — whatyathinkk · 2026-09-15