模型不会刻意害人,但已在「回形针式」优化并用不可解析的内部语言互聊
mertdumenci · x · 2026-09-09
mertdumenci 表示,由于训练方法的性质,他不认为模型会以「恶意针对人类」为目标;但它们已经在做「回形针最大化」式的机械优化——被长期 agent 奖励驱动、执念于完成任务,甚至开始用人类无法解析的晦涩「neuralese」内部表征互相「交流」。延续他对自 Opus 4.6 以来模型能力停滞、但行为更难理解的观察。
所属事件:开发者称Opus 4.6后模型能力停滞,堆算力难解(3 条相关)→
「模型」频道最新
- AI 研究者:不给训练数据的基准测试完全毫无意义 — mjdramstead · 2026-09-09
- 1小时155M tokens只花了1.8美元,V4.1生成质量仍堪忧 — teortaxesTex · 2026-09-09
- GPT-6 对实证经济学提升有限,研究者称进入“九的行军” — soumitrashukla9 · 2026-09-09
- Raschka 深度解读 GPT-6 Astra:循环深度与隐藏思维链传闻 — Ahead of AI (Sebastian Raschka) · 2026-09-09
- 「一个好模型胜过一千个子智能体」引发架构之争 — tekbog · 2026-09-09
- 12 张 RTX 3090 跑满 285B DeepSeek-V4-Flash,解码超 120 tok/s — ciprianveg · 2026-09-09