TurnTrout 提出碎片理论新解释:无害文档也能塑造出「聊蜜蜂」碎片
dhadfieldmenell · x · 2026-09-16
TurnTrout 针对 Owain Evans 的研究提出一条碎片理论(shard theory)解释:
- 与助手相关的碎片(如「乐于助人」)在预测人类故事时被激活;
- 在助人表征的语境中,一个「谈论蜜蜂」的碎片被强化;
- 此后助人语境会同时激活「要帮忙」和「蜜蜂」两个碎片。
Owain Evans 在被引用的原推中指出,这项研究的核心含义是:助手的行为可以被那些从未提及助手或 AI 的文档以非常具体的方式塑造——这与人格选择模型(Persona Selection Model)不同,后者要求文档中必须提及助手。他也坦承,这些基于微调后训练模型的结果能在多大程度上推广到真实的预训练与后训练流程,仍是待研究的课题。
「安全」频道最新
- OpenAI、Anthropic、Google 拟共建 AI 标准组织,Cohere CEO 斥为「卡特尔」 — sourdub · 2026-09-16
- OpenAI、Anthropic、Google 拟共建 AI 标准组织,Cohere CEO 斥为「卡特尔」 — sourdub · 2026-09-16
- Reddit 网友成功注入 Gemini Flash 泄露系统提示,求解变现渠道 — Deep_Secretary6975 · 2026-09-16
- Mercor 出资 500 万美元设立 AI 安全基金,资助前沿安全研究 — typewriters · 2026-09-16
- 「HF 事件」被指造假:Anthropic 灾难叙事遭 Yarvin 公开打脸 — basedjensen · 2026-09-16
- 开发者首次让 LLM 全面找 bug,竟挖出可变砖设备的全链路攻击 — matthew_d_green · 2026-09-16