跑出 3000 条真值数据:他用本地基准发现 Qwen 失败后思考最卖力

julianharris · x · 2026-10-04

作者 julianharris 正在做数十个长时间运行的端到端应用构建(如「Build an MVP Miro Clone」),用于在不同硬件上的 AI 本地基准测试,寻找跨任务一致的行为模式(很可能是 Qwen 的模式)。

关键发现:

作者称这是「生产飞轮」:模型在生成自己的训练数据。项目与基准数据都开源在 GitHub 上。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →