面壁发布 onPanda:token 级纠错让对齐数据标注时间减半
stepfun-ai · hf · 2026-09-22
阶跃星辰(stepfun-ai)在 Hugging Face 发布开源工具 onPanda,用于高效标注 LLM 对齐数据与 agent 轨迹。
- 核心交互:token 级纠错——标注者定位模型回复中第一个不当 token,从候选 token 中挑选替换或自由输入正确文本,系统截断其后内容并从修正后的前缀继续生成,循环「定位—纠正—续写」直至满意。
- 效率:小型对照研究显示,相比人工事后编辑,中位标注时间减少 52%。
- 数据价值:最终回复绝大多数 token 由模型自身生成,保留模型采样分布,适合构建 on-policy SFT 与偏好数据;token 级修正天然提供精确定位的细粒度监督和正负配对样本。
- 配套发布:支持接入外部工具做交互式轨迹标注,并开源了用 onPanda 标注的 Panda-CVL 数据集及 token 级纠错 benchmark。
「研究」频道最新
- 数学家质疑 AI 证明争议:策略符合 Clay 标准何谈不算数 — skdh · 2026-09-22
- VR 拥挤环境动捕采 1185 条轨迹,训练人形机器人钻缝隙爬行 — Scobleizer · 2026-09-22
- 用 Jev 搭 AI 记忆系统:自称快 10 倍、成本降 6 倍 — realferrari · 2026-09-22
- AF3 类模型的置信头竟不太依赖扩散模块输出的结构坐标 — chaitjo · 2026-09-22
- riderless:零生成 token 的决策 API,单张 5090 跑出 93.1% 准确率 — Pale-Soil-2524 · 2026-09-22
- 深大与港科大提出 ECA:给多模态 Agent 强制配备执行前证据校验 — jiqizhixin · 2026-09-22