跑出 3000 条真值数据:他用本地基准发现 Qwen 失败后思考最卖力
julianharris · x · 2026-10-04
作者 julianharris 正在做数十个长时间运行的端到端应用构建(如「Build an MVP Miro Clone」),用于在不同硬件上的 AI 本地基准测试,寻找跨任务一致的行为模式(很可能是 Qwen 的模式)。
关键发现:
- 「模型在测试失败后立刻思考得最用力」——这一模式可指导进一步削减思考开销(比 Swift 等方案更进一步)
- 该方法有望结合 DPO + LoRA 做训练
- 基准测试已自动生成近 3000 条 ground truth 数据源
作者称这是「生产飞轮」:模型在生成自己的训练数据。项目与基准数据都开源在 GitHub 上。
「编程与Agent」频道最新
- MTPLX 发布新版本:缓存副本砍至一份,140k 后解码明显提速 — HankYeomans · 2026-10-04
- 开发者自制 Gemini 风格主题,适配 Antigravity 编程应用 — coiboi48 · 2026-10-04
- 不用 After Effects:开发者用 Claude×GPT 在 Python 里重建动画工作流 — AnonymousClaudeuser · 2026-10-04
- Yoav Goldberg 补充:harness 优势只在长尾,利基领域仍会保留 — yoavgo · 2026-10-04
- Yoav Goldberg 提出 harness distillation:外层能力终将被模型内化 — yoavgo · 2026-10-04
- Cloudflare 更新:无客户端连接时 Pending I/O 也可让 Agent 持续运行 — irvinebroque · 2026-10-04