HANDRAISER 分任务降本数据:辩论任务省 48.9% 通信成本
lileics · x · 2026-09-23
作者推文串第 6 条给出分任务数据:使用 Llama-3.1-8B 作为听众时,HANDRAISER 在 Text Pictionary 上降本 24.3%、会议安排上降本 23.4%、MMLU-Pro 辩论上降本 48.9%,平均降本 32.2%,任务性能持平或更优。同事件详情见另帖完整摘要。
「研究」频道最新
- Yarin Gal:LLM 写的实验不能复现,与其他不可复现实验无异 — yaringal · 2026-09-23
- Yarin Gal:不復现的 LLM 实验与普通失败实验无异,或建 AI 版 arXiv — yaringal · 2026-09-23
- Artificial Analysis 发布 AA-Omniscience:仅 3 个模型不比瞎猜更易幻觉 — geoffwolfe · 2026-09-23
- 牛津 Yarin Gal 提议 arXiv 禁收 LLM 撰写的论文,防学术灌水 — yaringal · 2026-09-23
- 论文证明直推式 conformal prediction 存在置信-效率根本性权衡 — _onionesque · 2026-09-23
- 安全老兵发问:10 亿美元加无限 token,如何真正改变网络安全 — chrisrohlf · 2026-09-23