AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

表形式データ特化の基盤モデル「Mitra-v2」、業界大規模モデルと同水準の精度を77Mパラメータで実現

公開:2026年9月9日, 最終更新:2026年9月9日

30秒サマリー

  • Mitra-v2は合成データのみで学習した表形式データ向け基盤モデルで、信用リスク評価や設備故障検知などで最先端性能を達成
  • パラメータ数は77Mと、比較対象の業界モデル(1.6B)のわずか5%のサイズで同等の精度を実現
  • モデルの重みや推論・ファインチューニングコードをApache-2.0ライセンスで公開

何が起きたか

2026年9月3日、Yefan Taoら15名の研究者がarXivにテクニカルレポート「Mitra-v2」を公開した。Mitra-v2は、信用リスクスコアリング・臨床予測・設備故障検知・住宅価格推定といった実世界の分類・回帰問題に対応する表形式データ(タブラーデータ)向けの基盤モデルである。前バージョンMitra-v1と比較して、事前学習の分布がより大規模かつ多様な合成データのみを使用している点が特徴で、2次元Transformerを基盤としながら、より長いコンテキストと大規模な特徴空間をサポートする。

ベンチマーク評価では、300以上の実世界データセットを含むTabArenaとTALENTの2つのベンチマーク上で性能を検証。TabArena全体では、業界スケールのTabFM(1.6Bパラメータ)およびEXAONE Tabularモデルと同水準の性能を達成する一方、TabPFN-3を分類・回帰の両タスクで大きく上回ったとしている。Mitra-v2のパラメータ数は77Mであり、TabFMの約5%のサイズで同等の性能を実現している。

また、Mitra-v2は事前学習時に最大10クラスのタスクのみを使用しているにもかかわらず、10クラスを超える分類タスクでTALENTベンチマークにおいて首位となっている。モデルの重み、推論コード、ファインチューニングコード、評価結果はApache-2.0ライセンスのもとで公開されている。なお、本論文はarXivへの投稿段階であり、査読を経た論文誌への掲載が確認されているわけではない。

原典ハイライト

Mitra-v2は77Mパラメータながら、1.6BパラメータのTabFMと同水準の精度を達成。合成データのみでの学習にもかかわらず、300以上の実世界データセットを用いた2種のベンチマークで最先端水準の性能を示し、モデル・コード一式をApache-2.0で公開した。

出典: arXiv cs.LG(論文)

So What?(なぜ重要か)

編集部の分析として:表形式データは金融・製造・医療など多くの産業で依然として主要なデータ形式であり、そこに特化した小規模・高精度なオープン基盤モデルの登場は、AI導入コストと開発工数の大幅な削減につながる可能性がある。特に自前での大規模データ収集が難しい中小規模の組織にとって、合成データのみで学習されたモデルが実データで競争力ある性能を示す点は注目に値する。

日本企業への示唆

日本企業への示唆(編集部分析):金融機関の与信スコアリングや製造業の設備予知保全、不動産評価など、表形式データを扱う業務は幅広い。Mitra-v2はApache-2.0ライセンスで公開されているため、社内データを外部サービスに送らずオンプレミス・プライベートクラウド環境で活用できる選択肢となりうる。まずはベンチマーク評価の詳細と自社データへの適合性を確認し、TabPFN-3などの既存ツールと比較検証することが現実的な第一歩となろう。

背景・経緯

タブラーデータ向けの機械学習モデルはこれまで、XGBoostなど勾配ブースティング系手法が主流だったが、近年はTransformerベースの基盤モデルをタブラーデータに応用する研究が活発化している。Mitra-v1が前バージョンとして存在することが論文中で言及されているが、詳細は原文では明示されていない。競合モデルとしてTabFM、EXAONE Tabular、TabPFN-3、TabICLv2が言及されている。