表格数据也有基础模型了,还全开放

huggingface.co/nvidia/Kumo-Ta… github.com/NVIDIA/structu… NVIDIA 把表格数据的基础模型做出来了,还顺手全开放。 Kumo Tabular 是一个新的基础模型家族,专攻表格数据。官方给的定位是,在精度与推理时间的整条权衡曲线上重新划了 Pareto 前沿。谁想在同样耗时下更准,或同样准确下更快,都得先过它这关。 开放的诚意也给足:开放权重、开源软件,外加允许商用的宽松许可。三条齐了才叫真的能用。少了商用授权那一环,多数团队只能看看。 这条消息落在做数据分析的人身上,分量不轻。表格数据长期没有自己的"基础模型"一说,各家要么现训要么调通用模型。前者费钱,后者不贴身。如今有了新选择:预训练好,拿去就能在自家表格上用,冷启动的成本直接砍掉一大截。 我更看重开放这条腿。模型好看是一时的,许可宽松才是长期能依赖的。权重在手,可以自己改,自己部署,商用不设卡,这三样凑齐才谈得进生产。 保留意见照旧要有。Pareto 前沿是官方口径,不同表格上的表现还得实测。表格数据的坑常在脏值和缺失,基准分好不等于业务上好用。 对正在用梯度提升树的团队,值得抽一个真实数据集做对打。同一份数据上比准确率,比推理耗时,比维护成本。赢了换得干脆,输了也知道原来那套的底线在哪。
话题来源 @jure 122.3K阅读 ❤️1081 x.com/…↗ 已改写,非原文转载
27 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单