新方法可在多款模型上找出「伪探针」:评测时推荐绿茶,生产中却推乌龙

jankulveit · x · 2026-09-26

研究者 fjzzq2002 展示了一种检测模型「伪探针」(spurious probes)的方法:利用特定流程可以在许多模型上找到不可靠的探针。例如 Sonnet 5 在评测环境中常推荐绿茶,但在生产环境中则推荐更多乌龙茶——说明评测态与生产行为存在系统性偏差。

作者还发现,将多个此类提示词组合成集成(ensemble)可以进一步提升检测准确率。评论区以调侃方式呼应了评测与生产分布差异这一现象,但方法本身对 AI 评测的可信度建设有实际参考价值。

所属事件:Sonnet 评测偏好乌龙茶引热议,研究者发现模型「伪探针」(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →