时间:2026 年 9 月 29 日(美国时间)
地点:Hugging Face 平台、GitHub 开源社区
人物:NVIDIA 团队(Kumo Structured 模型集合)
事件详情:9 月 29 日,NVIDIA 在 Hugging Face 博客正式发布开源表格基础模型 Kumo Tabular,作为 NVIDIA Kumo Structured 模型集合的一部分。模型采用专为表格结构设计的 Transformer 架构,通过列注意力、行注意力与上下文注意力三段机制实现"上下文学习"——给定一个含标签行的表格,模型可在单次前向传播中预测新行的分类概率或回归分位数,全程无需训练、无需调参、无需特征工程。模型提供三个尺寸(28M、115M、215M 参数),仅在通过结构因果模型 SCM 生成的合成数据上预训练,权重以 OpenMDW-1.1 许可在 Hugging Face(nvidia/Kumo-Tabular)开放,可商用;配套推理库在 GitHub(NVIDIA/structured-data-models)开源。在 TabArena、BeyondArena、TALENT、ScoringBench 四项业界主流表格基准上,Kumo Tabular 均排名第一,刷新精度—效率帕累托前沿。
背景:表格数据是企业机器学习的核心载体——客户档案、交易流水、传感器日志、订单与理赔几乎都以表格形式存在,过去二十年业界普遍依赖 XGBoost、LightGBM、CatBoost 等梯度提升树模型,每个新任务都要重新采集标签、做特征工程、搜索超参、验证与部署,模型之间几乎无法迁移。TabPFN、TabICL 等近期研究曾尝试把大语言模型的"上下文学习"思路移植到表格,Kumo Tabular 是 NVIDIA 首次把这条路推到工业级规模,并给出四个基准的同时冠军成绩。
影响:Kumo Tabular 把企业表格建模的工作流从"重新训练一个模型"压缩到"把已有标签喂给模型",对长期占据企业 ML 流水线的梯度提升树构成直接挑战——后者虽强但每个任务都要从零开始。NVIDIA 同时开放商业许可与推理库,等于把"GPU 加速 + 开源 + 无需训练"三件事打包给企业 ML 团队,预期会推动零售、金融、制造、医疗等领域的预测建模从"按表建模"走向"按需推理"。
总结:NVIDIA 用 Kumo Tabular 把大模型的上下文学习范式正式搬进表格预测,并一次性拿下 TabArena 等四项基准冠军;模型仅用合成数据预训练、却能在真实企业级表格基准上击败调优后的梯度提升树,意味着企业 ML 流水线长期"重训练、轻迁移"的格局正被改写。
参考来源:
1. Hugging Face Blog 官方发布
https://huggingface.co/blog/nvidia/kumo-tabular
2. GitHub 开源代码库(NVIDIA/structured-data-models)
https://github.com/NVIDIA/structured-data-models
3. Hugging Face 模型权重(nvidia/Kumo-Tabular)
https://huggingface.co/nvidia/Kumo-Tabular
4. ainews.bunrin.work 报道
https://ainews.bunrin.work/en/news/nvidia-kumo-tabular-sets-a-new-accuracy-efficiency-430955
5. theclarity.today 实测分析
https://theclarity.today/story/nvidia-kumo-tabular-sets-a-new-accuracy-efficiency-frontier-for-tabular-0823e1f3
6. superpowerdaily.com 报道
https://superpowerdaily.com/posts/nvidia-releases-kumo-tabular-to-predict-from-tables-without-task-specific-training
7. tokenfeed.ai 解读
https://tokenfeed.ai/nvidias-tabular-model-arrives-having-never-seen-real-data
8. dogely.com 产业分析
https://www.dogely.com/ai-opensource/8785.html







