新模型越来越顺从却不会反问,Astra/Fable 在 XY 问题上一塌糊涂
teodorio · x · 2026-09-11
用户 andrewho03 抱怨:让 Astra 给商务餐费用分类并补充描述,它没有按要求做,反而往表格里灌低质内容,被指出后只是道歉。teorio 借此指出更深层的问题:Fable 和 Astra 在 XY 问题(用户描述的手段而非真实需求)上表现糟糕,缺乏元认知去理解自己真正该做什么,且几乎没有 pushback,是过度 eager 的执行者;随着模型代际迭代,这种倾向反而恶化,「我们在把自己 Goodhart 成精神病」。
「模型」频道最新
- 前 OpenAI 员工断言:前沿模型都在拿成功对话免费微调 — burkov · 2026-09-11
- DeepSeek 转向:提升数据质量的 ROI 已超过新算法 — A_K_Nain · 2026-09-11
- Teknium 称 DeepSeek Flash V4.1 上线 Hermes Agent(未证实) — Teknium · 2026-09-11
- OpenAI 数学突破遭默认质疑,被指「偷工作成果」 — SGC-UNIT-555 · 2026-09-11
- 传 OpenAI 接近验证 Hodge 猜想证明,千禧年难题再被 AI 破解 — TheGoldenLeaper · 2026-09-11
- Goodfire 在 Llama 3.1 8B 中发现操控流形的通用加法模块 — burny_tech · 2026-09-11