Claude基础模型异常输出实为用户建模

近期 Claude 基础模型(base model)在无约束状态下,自发输出了包含“Human”轮次的完整对话,被部分人误认为是模型在表达真实想法或泄露“内心独白”。开发者 cephaloform 对此进行了澄清与技术分析,指出这实际上是模型基于历史上下文进行的用户建模,而非模型本身的心声,这一现象在 Mistral、Llama 等模型的高温采样下也会短暂出现。

已确认

尚未确认

为什么重要

2026-07-30 ~ 2026-07-30 · 5 条相关

一手来源