研究者预告将发布 Act I 数据可解释性 PDF 报告
amplifiedamp · x · 2026-08-23
作者 @amplifiedamp 公布了从 Act I(2024年7月至2025年4月)数据中分解出的 100 个标签。并提到 @eigenslurml 计划发布一份更详细的 PDF 报告,利用此方法及其他可解释性技术分析数据。相关笔记指出,为避免使用小嵌入模型(SONAR)生成激活并反转质心为标签时的异常,未来工作可能会使用仅解码器的 LLM。
「研究」频道最新
- AI 框架通过 H&E 图像预测尿路上皮癌预后 — anantm · 2026-08-23
- AgentDojo 数据窃取降为 0%,新论文解决权限组合攻击 — GoodMarch3690 · 2026-08-23
- 单张 H100 训 8 天:1.2B 参数游戏配乐生成模型开源 — Amazing-You9339 · 2026-08-23
- 如果思维链可逆?用 Toffoli 门式逻辑给端侧 LLM 省内存防幻觉 — Fear_ltself · 2026-08-23
- 获资助创建本地 LLM 经济研究指南,寻求隐私数据与机构合作案例 — aniketapanjwani · 2026-08-23
- 新研究揭示 LLM API 重大漏洞:可窃取推理轨迹并越狱 — Machine Learning Street Talk · 2026-08-23