过度 RL 让模型变得字面化?CoT「粗人语」损害推理连贯性
mike64_t · x · 2026-09-09
作者对比认为代号 Fable 的模型在推理中更能召回软性信息、做出 OpenAI 模型几乎不会的「软跳跃」,而 OpenAI 模型令人痛苦的过度字面化,根源可能在于过度 RL 加上 CoT 的「粗人语」(caveman speak)压缩了推理的表达空间,连系统提示都要专门写「仅承认能帮忙是不够的」。
观点要点:
- 粗暴暴力解难题的经济价值有限,其他几乎所有经济相关任务都被「粗人语」或 RL 过度训练拖累
- 「Fable 太大而不便重度 RL」的传闻反而可能因祸得福,避免训练出过度字面化的模型
- 担忧 Fable 5.1 略微收敛彩色语言是不利方向,希望 Anthropic 保证不影响 CoT 质量
「模型」频道最新
- 三台未标定相机一提示搞定机械臂标定,误差小于0.2毫米 — burny_tech · 2026-09-09
- 爆料:去数据留存条款成企业采用关键,Fable 5.1 企业支出占比升至 22.5% — zephyr_z9 · 2026-09-09
- ChatGPT 网页版书签项目报 React #418 错,应用内却正常 — rohanpaul_ai · 2026-09-09
- Scale CEO 力推助手评测:Muse 综合得分 9.3,4–1 胜 Instinct — alexandr_wang · 2026-09-09
- GPT 6 Astra 20分钟一发复刻童年游戏 Re-Volt 并自行试玩 — nickbaumann_ · 2026-09-09
- 扎克伯格:Meta 已开始训练 Watermelon 之后的更大模型 — rohanpaul_ai · 2026-09-09