PLSemanticsBench:熟悉符号被翻转含义比陌生符号更伤性能
jessyjli · x · 2026-07-07
继 PLSemanticsBench 的发现:出人意料的是,把传统运算符替换成此前与该运算无关的随机符号,模型几乎不受影响;而把一个熟悉符号的含义翻转,则会显著伤害性能。也就是说,与模型已有知识的冲突,比完全未知带来的打击更大。
所属事件:PLSemanticsBench揭示大模型难真按规则推理(4 条相关)→
「研究」频道最新
- 研究发现,结构集成比单一预测更能提升 TCR:pMHC 泛化 — quaidmorris · 2026-07-22
- 结构集合而非单一预测,支撑 TCR:pMHC 泛化 — quaidmorris · 2026-07-22
- enFoldX 用 AlphaFold3 结构噪声预测 TCR 识别 — quaidmorris · 2026-07-22
- enFoldX 在 8 个 neoantigen 数据集上拿到领先结果 — quaidmorris · 2026-07-22
- enFoldX 在 human VDJdb 上达 AUC 0.82 并可迁移到 mouse — quaidmorris · 2026-07-22
- enFoldX 从 AF3 ensemble 提取 106 个界面特征 — quaidmorris · 2026-07-22