公開:2026年9月30日, 最終更新:2026年9月30日
30秒サマリー
- NVIDIAが表形式データ向けオープン基盤モデル「Kumo Tabular」をHugging Faceで公開した
- 学習・チューニング・特徴量エンジニアリング不要で分類・回帰予測をシングルフォワードパスで実行
- TabArena・BeyondArena・TALENT・ScoringBenchの4ベンチマークで首位を記録
何が起きたか
NVIDIAは2026年9月29日、表形式データ向けのオープン基盤モデル「Kumo Tabular」をHugging Faceで公開した。同モデルはNVIDIA Kumo Structuredモデルコレクションの一部であり、OpenMDW-1.1ライセンスのもと商用利用が可能。モデルサイズは28Mから215Mパラメータの3種類(Small・Medium・Large)が用意されており、コードとウェイトはそれぞれGitHubとHugging Faceで入手できる。
Kumo Tabularの最大の特徴は、ラベル付き行を含む表を入力として与えるだけで、追加の学習・ハイパーパラメータ探索・特徴量エンジニアリングなしに、新しい行の分類または回帰予測をシングルフォワードパスで返すことにある。これはLLMの「インコンテキスト学習」を表データに適用したアプローチであり、ラベル付き行をコンテキストとして読み込み、未知ラベルの行を直接予測する仕組みだ。
モデルは実際のデータではなく、構造的因果モデル(SCM)から自動生成された人工的な表データのみで事前学習されている。Small/Medium/Largeはそれぞれ約3,500万・7,100万・1億3,700万枚の人工テーブルで学習済みだ。評価では、TabArenaで総合ELO 1950で首位となり、同等精度帯の競合モデル「LimiX-2」と比較してRTX 6000 Pro環境において17倍高速と報告されている。BeyondArena、TALENT、ScoringBenchでも首位を獲得した。
利用にはNVIDIAがオープンソースで公開したGPUネイティブライブラリ「sdm(structured-data-models)」を使用し、pandas DataFrameから数行のコードで予測が得られる。なお、対応するのは数値列・カテゴリ列のみで、テキストや画像・タイムスタンプは組み込みの前処理レシピで変換する必要がある。また、1回のフォワードパスでカバーできるクラス数は最大10だが、ライブラリの誤り訂正出力符号により任意のクラス数に対応可能としている。
原典ハイライト
公式ブログは「表データ向け機械学習の従来サイクル——ラベル収集・特徴量設計・ハイパーパラメータ探索・モデル学習——を、インコンテキスト学習によりゼロにする」という設計思想を明示。全て人工データで事前学習した点と、4ベンチマーク首位および精度効率フロンティア更新を核心的成果として打ち出している。
出典: Hugging Face Blog(公式ブログ)
So What?(なぜ重要か)
これまで表形式データの予測タスクは「勾配ブースティング+特徴量エンジニアリング」という定型工程が不可欠だった。Kumo Tabularが普及すれば、データをそのまま渡すだけで予測が得られる運用が現実的となり、データサイエンティストの作業工程と初動コストが大幅に短縮される可能性がある。一方でモデルはGPU実行前提であり、学習範囲を超えるデータや分布シフトには精度劣化リスクがあるため、本番運用前の検証は依然として必要だ。
日本企業への示唆
日本企業が顧客購買履歴・センサーログ・与信データ・在庫などを扱う際、従来は専門人材によるモデル構築工程が必要だった。Kumo Tabularはその工程を省略し、表データと数行のコードで予測を試せる入口を提供する。PoC検証のスピードが上がる一方、GPUインフラとOpenMDW-1.1ライセンスの条件確認、および自社データでの精度・キャリブレーション検証の体制整備が実用化の前提となる。まず社内の小規模分類・回帰タスクで比較実験することが現実的な第一歩といえる。
背景・経緯
企業の機械学習は長年、勾配ブースティング系モデルが主流であり、タスクごとにゼロから学習するサイクルが続いてきた。LLMがインコンテキスト学習でファインチューニング不要の推論を実現したのと同様のアプローチを表データに適用しようとする研究潮流(TabPFN・TabICLなど)が存在し、Kumo TabularはNVIDIAがその流れに基盤モデルとして参入した位置づけとみられる。




