三个简单推理技巧让 Activation Oracle 效果大幅提升
a_karvonen · x · 2026-09-28
Adam Karvonen 在 LessWrong 发文,给出显著改善 Activation Oracle(AO,接受 LLM 激活作为输入模态并回答自然语言问题的模型)可用性的三个推理期技巧:
- 提供多 token 而非单个 token 的激活:在仿照 Jakkli et al. 的 Qwen3-8B「回溯行为」评测中,只用最后一个 token 激活时 AO 接近随机水平;20 token 时追平直接问 Qwen3-8B 全文上下文的基线,50 token 时反超。
- 多次采样并检查一致性以缓解幻觉:AO 未被训练表达不确定性,可能自信地犯错;采样 10 次看共识即可得到干净的 precision/recall 曲线。
- 二元分类问题用 AUC 而非 accuracy 评估。
文末还讨论了作者对 AO 与 NLA 两类方法的看法。
所属事件:三项简单推理技巧大幅提升 Activation Oracle 效果(2 条相关)→
「研究」频道最新
- 用 4 张 V100 直播后训练 80B MoE 基座:96 小时蒸馏 3340 条数据 — jjusko20 · 2026-09-29
- 300K 真人标注视频偏好数据集开源,15 个 SOTA 视频模型同榜排名 — _akhaliq · 2026-09-29
- 哥本哈根学者质疑:Anthropic 宣称的 AI 独立科学发现可能早被人做出来了 — JFPuget · 2026-09-29
- 研究者:理论支撑的智能体科学或可判定系统是否具有意识 — aran_nayebi · 2026-09-29
- JevBench 与 JevImageBench 排行榜即将上线 — airesearch12 · 2026-09-29
- 预注册研究假设未获支持,论文却改口称“探索性” — RexDouglass · 2026-09-29