小米开源表格数据大模型Xiaomi-TabLDM:一个模型”通吃”所有表格?

AI资讯3天前发布 EdgeClaw
5 00

9月5日,小米正式发布通用表格数据基础大模型Xiaomi-TabLDM,并宣布开源,模型权重、代码与技术报告已全部公开。这款模型以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或后置集成,即可完成分类与回归预测。

打破”一表一模型”的旧模式

蓝色数据表格矩阵与AI处理光路界面图,展示小米Xiaomi-TabLDM通吃各类表格数据的通用能力

长期以来,金融、医疗、制造、物流等领域大量核心数据以表格形式存在,但传统表格机器学习通常需要针对每一个新数据集重新训练、调参甚至集成模型。每拿到一份新业务表格就要重来一遍,多套模型并存的维护成本居高不下。Xiaomi-TabLDM的目标,就是把”一次预训练、跨任务使用”的基础模型范式带入结构化数据领域,打破”一表一模型”的现状。

三项技术路线撑起通用能力

预训练方面,Xiaomi-TabLDM完全基于结构因果模型生成的大规模合成数据进行预训练,覆盖不同数据规模、变量类型、依赖关系和函数关系,扩大了预训练任务的分布。

智能工厂机械臂与全息精度曲线界面,展示Xiaomi-TabLDM在材料性能预测中的工业落地应用

模型架构方面,它引入双流特征分组、轻量级注意力残差和稀疏混合专家机制,从不同粒度建模特征关系,通过稀疏专家扩大模型容量,同时避免计算量同步暴涨。推理方面,模型进一步探索了Test-Time Scaling,在保持参数不变的情况下,通过增加推理阶段算力持续提升预测性能。

四大基准全部第一梯队

在TALENT、OpenML-CTR23、BCCO、TabArena四大公开基准评测中,Xiaomi-TabLDM整体跻身第一梯队:OpenML-CTR23回归榜排名第一,TALENT二分类任务同样第一,BCCO总体第二、TabArena回归任务第二。在性能与效率的平衡上,以TabArena回归任务为例,它在取得第二高Elo评分的同时,训练时间比排名第一的方案减少82%,预测时间减少68%。

工业场景已经用起来了

真实工业场景的验证更能说明问题。在材料性能预测场景下,Xiaomi-TabLDM无需微调即可将预测精度提升130%,减少约九成无效试模测试;零件重量预测相比传统方案失误样本占比下降31%;生产组分预测平均误差降低54%,工况变化时仅需补充约30条新样本作为上下文,平均误差就能再降62%。

从医院化验单到工厂生产记录,再到公司财务报表,一个模型通吃所有表格——这种”开箱即用”的体验,或许正是表格数据处理走向基础模型化时代的关键一步。

© 版权声明

相关文章