Aiden Bai:模型评测工具链拉胯,每家公司 posttrain 前先补好 eval
aidenybai · x · 2026-10-10
Aiden Bai(Reflection AI 创始人)指出模型评测要在规模上落地,工具链的默认水平远远不够:
- Rollout 成本极高
- 假阳/假阴和 reward hacking 非常普遍且难以发现
- 指令写得差、测试过严很常见
- 人工检查数据极其费人力
结论:每个想做 posttraining 的公司,都得先把 eval 做好。行业普遍问题,非单一框架缺陷。
所属事件:Aiden Bai:行业评测工具链不足,posttrain 前须补强(2 条相关)→
「编程与Agent」频道最新
- 工程师认为抽象层对 AI agent 有害,95% 场景直接裸调更优 — zack_overflow · 2026-10-10
- 实测三个个人 agent 的主动通知能力:dot 抓出错日历,Muse 太吵 — hazelcough · 2026-10-10
- 个人AI Agent开始记住工作模式并自建联系人CRM — thisiskp_ · 2026-10-10
- 创作者实测生成式模型:文本提示不是唯一交互,值得做更丰富界面 — keenanisalive · 2026-10-10
- VLM 看图能力不均,「do better」式提示很快失效 — keenanisalive · 2026-10-10
- 用「相信你自己」提示法调教 LLM 写 3D SDF 模型实测 — keenanisalive · 2026-10-10