英伟达 9 月 29 日在 Hugging Face 发布 Kumo Tabular,属于 Kumo Structured 模型系列。给定一张已有标签的表,它在一次前向里预测新行的标签,分类和回归都可以,不需要再训练、调参或做特征工程。它只在人工数据上预训练,有三种尺寸,参数从 2800 万到 2.15 亿。通过开源库运行,许可是 OpenMDW-1.1,可以商用。模型代码在 GitHub 的 NVIDIA/structured-data-models,权重在 Hugging Face 的 nvidia/Kumo-Tabular。

[1]
石板粉笔:一格格空着,只有下面一行里的一格点了赭色。
整张格子几乎是空的,只有一格被点上。它对应读进已有的行之后,给新的一行一个结果。这是插画,不是数据表。, AI 生成插画,不是新闻照片

它是围绕表结构做的 Transformer,用了列注意力、行注意力和上下文注意力。预测要做三件事:看懂一个值在自己那一列里的位置,看懂一行里各列如何互相作用,再把带标签的上下文行和没有标签的查询行联系起来。数值和类别走不同的权重。缺失值不必填补。查询行只看上下文,不看其他查询行,所以上下文的键和值可以算一次、后面复用。分类输出类别概率,回归输出 999 个分位数,再得到点预测和不确定度。

训练表全部是人工采样的结构因果模型。分类和回归分成两个模型。小、中、大三个尺寸大约看过 3500 万、7100 万和 1.37 亿张人工表。训练配方和数据生成器写的是即将发布,还没有随这篇一起给出。

[1]

发布文说,三种尺寸都以默认设置对过 TabArena 榜,对照包括调过的梯度提升树、AutoGluon 和较新的表格基础模型。Kumo Tabular 总排名第一,TabArena 上的 ELO 是 1950。BeyondArena 上 ELO 是 1418,Improvability 为 7.78%,也是第一。TALENT 上,分类准确率、分类对数损失和回归 RMSE 的平均名次分别是 6.67、3.98 和 4.22,总排名第一。ScoringBench 上,Large 和 Medium 的平均名次是第一和第二。这些名次是这篇发布的转述,本篇没有打开榜单页。

限制也写了。它只直接处理数值列和类别列。文本、图像或时间戳要先用库里的预处理变成特征。一次前向最多覆盖 10 个类别,更多类别靠纠错输出码扩展。表远大于训练范围,或查询行和上下文行不是同一分布时,准确率可能下降。部署前要在自己的留出数据上检查准确率和校准。

[1]

要点

  • 有标签的表一次前向给出分类或回归,不必再训练或做特征工程。
  • 只在人工表上预训练。三种尺寸,2800 万到 2.15 亿参数,OpenMDW-1.1 可商用。
  • 发布文称它在 TabArena、BeyondArena、TALENT、ScoringBench 上排第一。TabArena 的 ELO 是 1950。
  • 只直接处理数值和类别。一次前向最多 10 类。分布变了要自行验证。