Kimi K3 在 69 项编码测试中领先,但 ML 流程错误仍常见
mariofilhoml · x · 2026-08-04
这条帖子在说,编码类大模型做这类机器学习工作时,大致已经接近“Competitions Master”水平,但离稳定可靠还差得远。
被引用的原帖拿 Zoomcamp 的销售预测数据做了一个特征工程助手测试,结果暴露出几个典型问题:
- 模型会在切分训练集之前就先做全量变换,有数据泄漏风险
- 被要求只用历史数据做 30 个日预测模型时,它仍然倾向于引入会泄漏未来信息的 rolling window
- 说明即使是强编码模型,在真实 ML 工作流里也可能犯基础但致命的错误
配图给出了一组模型任务通过数对比,Kimi K3 以 49/69 领先,后面是 Claude Opus 4.8 的 43/69 和 GPT-5.6 Sol xhig 的 41/69。整体信息是:模型在进步,但做 ML 工程仍需要很强的约束与检查。
「编程与Agent」频道最新
- 论文将 41 种 Agent 失败归因到模型与脚手架交互边 — omarsar0 · 2026-08-04
- 斯坦福 CS239A 自我改进 AI agents 课程已上 YouTube — mariofilhoml · 2026-08-04
- Cline 认为开源权重模型更适合留足自检空间 — cpaik · 2026-08-04
- WorkOS 在旧金山办 Agent Night,聚焦 context graphs 和现场演示 — davidcrawshaw · 2026-08-04
- 一份涵盖 DeltaNet、FlashKDA 和 MoE 的 AI 解释清单 — austinvhuang · 2026-08-04
- LeCun 说好的代码生成系统不只是自回归 LLM — ylecun · 2026-08-04