新媒体矩阵

小米发布开源表格大模型 单模型免调参跨表预测

小米9月5日发布并开源通用表格数据基础大模型,单模型免调参完成分类与回归预测,四大公开基准测试均进入第一梯队。

9月5日,小米发布并开源通用表格数据基础大模型Xiaomi-TabLDM,尝试用一次预训练换来越过数据集的通用预测能力。

098052697458eca610b4a84513ca95b6.png

按小米技术团队公布的信息,Xiaomi-TabLDM以单一预训练模型配合统一默认配置,直接适配结构各异的表格数据集,无需针对每个任务重训、调参或叠加模型,即可完成分类与回归两类预测任务。模型预训练完全基于合成表格数据完成,通过结构因果模型生成覆盖不同数据规模、变量类型、依赖与函数关系的任务样本;架构引入双流特征分组、轻量注意力残差与稀疏混合专家,扩大模型容量时控制计算量同步增长,并支持参数不变时通过增加推理计算量继续提升预测精度。

公开基准测试中,Xiaomi-TabLDM在TALENT、OpenML-CTR23、BCCO、TabArena四项评测中均进入第一梯队,TALENT二分类与OpenML-CTR23回归列第一,BCCO总体与TabArena回归列第二;回归任务训练时间较榜单居首的TabFM减少82%,预测时间减少68%。

575f34fb217ffce70151617985ea8f56.jpg

小米同时公布了三个真实工业场景的验证结果。新材料研发中,模型无需微调即把性能预测精度提升130%,减少约九成无效试模与装机测试;注塑件重量预测相比XGBoost,失误样本占比下降31%;生产组分预测的平均误差较XGBoost下降54%。当生产工况变化,仅补充约30条新样本作为上下文,平均误差再降62%,传统算法约需200条样本才能接近同等效果。

把模型开源,降低的是一类企业的使用门槛。传统表格预测主要依赖XGBoost、LightGBM等工具,特征是"一表一模型",新数据源进入后,特征工程、超参搜索、版本管理整套流程需要重来,没有专职算法团队的企业很难承担。预训练基座以开源方式放出,配合scikit-learn兼容接口与pip安装,有Python基础的使用者即可本地跑通预测流程,权重与代码已上传GitHub与Hugging Face。文本、图像之外,结构化数据是AI覆盖仍不充分的长尾场景,合成数据预训练与真实业务表格仍有落差,跨行业迁移效果有待更大规模验证。小米把权重开放,等于把验证交给产线——效果如何,由表格上的真实任务来回答。

ScreenShot_2026-09-05_133120_912.png

评论 0