77M 参数纯合成数据训练,Mitra-v2 登顶表格建模基准
chaumian · x · 2026-09-08
Mitra-v2 技术报告要点
- 模型定位:Mitra-v2 是表格基础模型(tabular foundation model),面向真实世界的分类与回归任务,覆盖信贷风控、临床预测、设备故障检测、房价估计等场景。
- 纯合成数据训练:预训练完全使用合成数据,任务分布比 v1 更大更多样;基于小型 2D Transformer 架构,支持更长上下文与更大特征空间。
- 成绩:在覆盖 300+ 真实数据集的 TabArena 与 TALENT 基准上,达到与工业级 TabFM、EXAONE Tabular 相当的 SOTA 水平,大幅超越 TabPFN-3;仅用 77M 参数(约为 1.6B TabFM 的 5%)就匹敌 TabFM 性能。
- 泛化亮点:虽只在最多 10 类的任务上预训练,却在 10 类以上的分类任务排名第一,是开源表格基础模型中综合最强的之一。
「研究」频道最新
- 传 Anthropic 模型解开千禧年大奖难题,陶哲轩回应价值之辩 — lukaszkaiser · 2026-09-08
- 禁用浮点与神经网络,日实验室用纯逻辑门造 Physical AI — cephaloform · 2026-09-08
- 六篇 ECCV 论文:覆盖多模态、Agent、3D 与具身 AI — liuziwei7 · 2026-09-08
- 数学家深挖 Lean 形式化证明:tactic 架构让证明难以像普通文本那样通读 — burny_tech · 2026-09-08
- Motus2 自进化世界模型:单模型三角色,五项灵巧任务平均成功率 84% — burny_tech · 2026-09-08
- 数学家实测 Astra:60 小时攻克两个未发表定理,3 挑战耗 2 万美元 — basedjensen · 2026-09-08