21 小时长跑后翻车:用户细数 Astra 建数据集的连串低级错误

ivan_bezdomny · x · 2026-09-07

用户 ivanbezdomny 让 Astra 连续 21 小时从零构建一个语法评分器并做优化,但对它构建数据集的质量明显降温。列举的问题:有 1 万条候选却标注了过少的样本;用 GPT-5.5-high 标注,试过 GPT-5.6-sol 发现更好却没有跟进替换;观察到独立标注批次间的方差,却没有尝试每条 3 个 agent 投票或按分歧加采样,也没改进标注 prompt。直到作者追问,模型才承认自己的评分体系站不住脚。作者表示仍是粉丝,但对 Astra 的好感在下降。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →