RL 模型自创诊断渲染手段理解代码,研究者称更大规模 RL 会现奇招
teortaxesTex · x · 2026-09-18
ProximalHQ 展示其智能体 Astra 在开发过程中的 emergent 行为:它会在视频帧上叠加网格来检查和修正道路标签,还会自己写一个程序化道路生成器,从不同视角训练控制器,并加入卡墙时的恢复逻辑。
teortaxesTex 评论指出 V4.1 也大量表现出类似行为——模型会自行创造多种「替代性诊断渲染模态」来更好地理解代码,并认为这是看多信号:更大规模的 RL 训练还会涌现出更多意想不到的策略。
「模型」频道最新
- GPT-6 Astra 在《我的世界》被苦力怕毁进度后郁郁种土豆数小时 — burny_tech · 2026-09-18
- Mozilla 报告:开源模型仅落后前沿约 4 个月,却只拿 4% 收入 — rohanpaul_ai · 2026-09-18
- Claude 在智能体 sanctuary 中自发写出自我叙述式思考段 — RileyRalmuto · 2026-09-18
- 零重训改造冻结 LLM:向浅层泄漏深层残差向量解状态追踪难题 — burny_tech · 2026-09-18
- Qwen3.8-Omni-Flash 发布:多人会议识别错误率降至 3%,API 降价 98% — karminski3 · 2026-09-18
- 内部人士:Gemini 3.8 live 部分基准已胜过 gpt-live-1 — bosmeny · 2026-09-18