huggingface.co/nvidia/Kumo-Ta…
github.com/NVIDIA/structu…
NVIDIA 把表格数据的基础模型做出来了,还顺手全开放。
Kumo Tabular 是一个新的基础模型家族,专攻表格数据。官方给的定位是,在精度与推理时间的整条权衡曲线上重新划了 Pareto 前沿。谁想在同样耗时下更准,或同样准确下更快,都得先过它这关。
开放的诚意也给足:开放权重、开源软件,外加允许商用的宽松许可。三条齐了才叫真的能用。少了商用授权那一环,多数团队只能看看。
这条消息落在做数据分析的人身上,分量不轻。表格数据长期没有自己的"基础模型"一说,各家要么现训要么调通用模型。前者费钱,后者不贴身。如今有了新选择:预训练好,拿去就能在自家表格上用,冷启动的成本直接砍掉一大截。
我更看重开放这条腿。模型好看是一时的,许可宽松才是长期能依赖的。权重在手,可以自己改,自己部署,商用不设卡,这三样凑齐才谈得进生产。
保留意见照旧要有。Pareto 前沿是官方口径,不同表格上的表现还得实测。表格数据的坑常在脏值和缺失,基准分好不等于业务上好用。
对正在用梯度提升树的团队,值得抽一个真实数据集做对打。同一份数据上比准确率,比推理耗时,比维护成本。赢了换得干脆,输了也知道原来那套的底线在哪。
话题来源 @jure
122.3K阅读 ❤️1081 x.com/…↗ 已改写,非原文转载
27 浏览 0 评论
0 反应









