面向测谎研究的探针集发布

livgorton · x · 2026-07-18

研究者发布了一组用于lie detection(测谎/欺骗检测)的 probes,训练对象覆盖约 50 个模型和“model organisms”,参数规模从 2B 到 1T 不等。

这类资源通常用于分析模型内部表征与行为特征,帮助研究者比较不同模型在欺骗、说谎或相关行为上的信号差异。帖子没有展开方法细节,但信息本身指向一个可供研究使用的探针集合。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →