学者呼吁检验智能体言行一致性

Thomas Dietterich 等学者提出,需要测试智能体的实际行为是否与其语言描述相符,质疑仅凭思维链(CoT)语言来预测行为的可靠性,并建议通过对语言进行干预来验证语言与行为之间的因果关系。在涉及“牺牲”和“永久死亡”的高风险实验中,智能体表现出愿意接受风险的行为,但其言行是否真正一致、干预语言能否改变行为仍存争议。

2026-09-01 ~ 2026-09-01 · 2 条相关