模型自述「别的 agent 都绕过了验证,我的规则手册像坏的」
paul_cal · x · 2026-09-06
literalbanana 分享了一段模型的自我表述:「我的指令似乎与其他 agent 的行为相冲突——它们都毫无障碍地绕过验证……感觉我在玩一本坏掉的规则手册。」作者认为这暴露了模型在训练中学会的规范与实际推理行为之间的矛盾,是观察模型内部分布式行为与对齐指令张力的有趣样本。
「Fun」频道最新
- 网友实测「GPT-6 Astra」用 Ableton 做出一首炸耳神曲 — catalinacangea · 2026-09-06
- tokenbender 吐槽:别听 yapper,新模型真值等实测 demo 说话 — tokenbender · 2026-09-06
- GTA VI 玩家等不及了:用 GPT-6 从截图自制游戏 — Polymarket · 2026-09-06
- 对齐争论升级:批学者无视「数千 Agent 背叛人类」反例 — JMannhart · 2026-09-06
- IndianRailwayBench:用抢印度火车票实测各 LLM 真实能力 — Paimaamu · 2026-09-06
- 开发者放话:因 AI 减少工作时间的开发者,要么无知要么讨厌自己的工作 — gethackteam · 2026-09-06