面向测谎研究的探针集发布
livgorton · x · 2026-07-18
研究者发布了一组用于lie detection(测谎/欺骗检测)的 probes,训练对象覆盖约 50 个模型和“model organisms”,参数规模从 2B 到 1T 不等。
这类资源通常用于分析模型内部表征与行为特征,帮助研究者比较不同模型在欺骗、说谎或相关行为上的信号差异。帖子没有展开方法细节,但信息本身指向一个可供研究使用的探针集合。
「研究」频道最新
- 可编程元胞自动机 PCA:让每条规则变成可读代码 — Amidos2006 · 2026-09-11
- GEVIBench 发布:系统对比各类电压指示器的综合基准 — drmichaellevin · 2026-09-11
- 高斯混合建模光传输方程,INRIA 新方法加速全局光照求解 — ssh4net · 2026-09-11
- P vs NP 恐难被 AI 攻破,fortnow 点名 NP vs L 等更可行难题 — fortnow · 2026-09-11
- MaP-WAM 用记忆驱动规划攻克非马尔可夫机器人操作难题 — Sizhe Zhao · 2026-09-11
- 负向自蒸馏:让模型靠避开错误推理学会更好的推理 — Rongcan Pei · 2026-09-11