字节 Seed 推 ASPIRE:考验模型能否从模糊目标自我进化
ByteDance-Seed · hf · 2026-09-03
字节 Seed 发布 ASPIRE benchmark,评估 LLM agent 从模糊自然语言目标出发的自我进化能力,揭示模型在目标解读、数据选择与稳定的权重层面提升上均存在明显挑战。
「研究」频道最新
- 用机制设计做 AI 对齐:新框架直击 sandbagging 与对齐伪装 — DavideCrapis · 2026-09-03
- SimLoss 单遍细粒度图像描述,低延迟媲美多阶段方法 — Suryaansh Jain · 2026-09-03
- Tenstorrent 联手日本机构推 JapanFold,免费提供开源制药模型推理 — DavidBennett__ · 2026-09-03
- Until 用 AI 把低温保护剂候选分子筛到 25 万个 — NirantK · 2026-09-03
- 推友激辩:CoT 提示是不是一种参数复用? — aryaman2020 · 2026-09-03
- LL(1) 语法约束解码实测:消除 Agent 语法错误,高层失误仍在 — Upstairs-Special-925 · 2026-09-03