CHIVE管线诊断模型行为,诱因从用词到语气千差万别
作者展示了可在任何模型或提示词源上运行的评估管线 CHIVE(通过编辑进行反事实假设调查),示例中揭示了 Gemma 会因变量名误导而写错代码。研究还发现模型行为的诱因差异巨大:既可能是提示词中的具体词汇,也可能是模型的怪癖(如记错演员事实),甚至是用户愤怒语气这类抽象属性。这种多样性使自动化诊断变得极为困难。
2026-08-22 ~ 2026-08-22 · 2 条相关
- CHIVE 管线揭示 Gemma 因变量名误导写错代码 — a_karvonen · 2026-08-22
- 模型行为诱因复杂:从具体用词到抽象语气 — a_karvonen · 2026-08-22