Anthropic 训练模型用数千条真实行为解释学会自我解释
a_karvonen · x · 2026-09-05
- akarvonen 介绍一项可解释性研究:用包含数千条模型对自身真实行为(如为何忽略用户请求、为何写错代码)解释的单一通用数据集做训练,模型能泛化到 held-out 评测上。
- John Schulman 转发并表态看好:有了可度量的解释质量指标就能做 hillclimb,counterfactual simulatability 是合理方向;该数据集+管线生成比以往更多样、更贴近真实的测试用例,还能训练模型写出更好的事后行为解释。
所属事件:Anthropic 训练模型自我解释行为并泛化到未见评测(5 条相关)→
「研究」频道最新
- 逆转 Eroom 定律:临床试验为何是生物医药的真正瓶颈 — anshulkundaje · 2026-09-05
- 争议预印本:用集成模型包住 LLM,声称实现现象性意识 — PeterBowdenLive · 2026-09-05
- 微调随机数也能传偏置,subliminal learning 让人不安 — ryanorban · 2026-09-05
- 调查668名开发者:读者一旦怀疑文章是AI写的就会拉黑作者 — IanArawjo · 2026-09-05
- Randomized YaRN 问世:短文本训练即可提升 128K 上下文推理 — gregd_nlp · 2026-09-05
- OpenAI 揭秘 Astra 训练法:主观领域如何做不可验证域的训练 — morqon · 2026-09-05