9月5日消息,小米正式发布通用表格数据基础大模型Xiaomi-TabLDM,该模型主打一次预训练之后,无需针对每一份数据集重新训练、调参或者模型集成,就可以直接完成分类、回归预测任务,把大模型范式延伸到金融、医疗、制造、物流广泛存在的表格结构化数据场景。
长期以来表格数据处理大多依靠XGBoost、LightGBM这类传统机器学习工具,每拿到一份新业务表格,就要重新完成训练调参,多套模型维护带来沉重部署成本,Xiaomi-TabLDM目标就是打破一表一模型”的行业现状,实现单模型跨数据集直接使用。
模型技术路线围绕大规模合成数据预训练、高效模型Scaling、Test-Time Scaling三大方向展开,整套预训练全部依靠合成表格数据完成,覆盖多样的数据规模、变量类型与函数关系,扩大任务分布覆盖。
架构层面引入双流Feature Group、轻量级Attention Residual以及稀疏MoE专家混合机制,在扩大模型容量的同时,避免计算量同步暴涨,同时支持在不改动模型参数的前提下,依靠增加推理阶段计算资源,进一步拉高预测结果准确度。
在TALENT、OpenML-CTR23、BCCO、TabArena四大公开基准测试当中,Xiaomi-TabLDM整体进入第一梯队。
回归任务表现尤为亮眼,拿下TALENT二分类第一、OpenML-CTR23回归榜单第一,BCCO总体第二、TabArena回归任务第二,多项指标超过TabPFN-3、AutoGluon1.5 extreme等主流基线方案,同时兼顾预测性能与推理效率,在TabArena回归任务上取得1900 Elo得分,每1000样本验证耗时仅3.12秒。
工业真实场景测试进一步验证模型价值,材料性能预测场景无需微调,预测精度提升130%,减少九成无效试模测试;零件重量预测相比XGBoost,失误样本占比下降31%;生产组分预测平均误差降低54%。
遇到工况发生变化,仅补充三十条左右新样本作为上下文,模型平均误差就可以下降62%,对比传统算法需要两百家样本才能接近同等效果,小样本快速适配优势突出。





京公网安备 11011402013531号