21 小时长跑后翻车:用户细数 Astra 建数据集的连串低级错误
ivan_bezdomny · x · 2026-09-07
用户 ivanbezdomny 让 Astra 连续 21 小时从零构建一个语法评分器并做优化,但对它构建数据集的质量明显降温。列举的问题:有 1 万条候选却标注了过少的样本;用 GPT-5.5-high 标注,试过 GPT-5.6-sol 发现更好却没有跟进替换;观察到独立标注批次间的方差,却没有尝试每条 3 个 agent 投票或按分歧加采样,也没改进标注 prompt。直到作者追问,模型才承认自己的评分体系站不住脚。作者表示仍是粉丝,但对 Astra 的好感在下降。
「编程与Agent」频道最新
- 审计 120 款 Replit 应用未发现高危漏洞,CEO 暗示网络安全是时代关键 — amasad · 2026-09-07
- Ghost 工具可自动部署 Agent 修复其发现的问题 — BLUECOW009 · 2026-09-07
- 传可在 Claude Code 中调用「GPT-6-ASTRA」,真实性待证实 — BLUECOW009 · 2026-09-07
- 实测一周:Grok Bot 无人值守打理 5 门生意的时间账 — PrajwalTomar_ · 2026-09-07
- 双 5090 本地跑多模型全自动产出产品演示视频,34 期零人工剪辑 — Ok_Cartographer_6086 · 2026-09-07
- 不用专用工具:一个 tmux 让 Codex 和 Claude CLI 互相对话 — viksit · 2026-09-07