30秒サマリー
- 表形式データ予測の基盤モデル「TabPFN-3.5」がarXivに論文公開、前バージョンおよび既存の全ベースラインを上回る精度を達成
- 高カーディナリティカテゴリ変数・テキスト・画像を含む表など、実務的なデータ形式への対応を大幅に拡張
- 高速推論版は前バージョン比最大3倍、思考モード版は最大12倍の速度向上を実現
何が起きたか
2026年9月15日、Benjamin Jägerら47名の研究者チームが表形式データ向け基盤モデル「TabPFN-3.5」の技術報告書をarXiv(cs.LG)に投稿した。著者にはBernhard SchölkopfやYann LeCunも名を連ねている。
本モデルは前モデルのTabPFN-3および既存の全比較対象モデルを幅広い表形式タスクで上回り、標準的な表データ予測ベンチマーク「TabArena」で最高精度を達成したとされる。対応データ範囲も拡張され、時系列分割・グループ分割など非独立同分布(非i.i.d.)のデータ、文字列・テキスト・画像を含む表、高カーディナリティカテゴリ特徴量、特徴量数の多いワイドテーブルにも対応している。さらに関係データと時系列予測の専用タスクでも最高水準の性能を示すとされる。
バリアントとして、推論速度を前バージョン比最大3倍に高めつつ精度の多くを維持する「TabPFN-3.5-Fast」、マルチモーダル対応と独自推論最適化を施した「TabPFN-3.5-Plus」、推論時計算をスケールさせる「TabPFN-3.5-Thinking」の3種類が存在する。TabPFN-3.5-ThinkingはTabPFN-3-Thinkingと比べ最大12倍の高速化を達成したと論文は述べている。
原典ハイライト
論文アブストラクトは「TabPFN-3.5 sets a new state of the art on standard tabular prediction in TabArena」と明記し、実務で遭遇する多様なデータ形式への拡張と、最大12倍の推論高速化を主要な貢献として挙げている。
出典: arXiv cs.LG(論文)
So What?(なぜ重要か)
表形式データは企業の販売・在庫・顧客管理など業務データの大半を占める。従来、表データの機械学習ではXGBoostなど勾配ブースティング系が主流だったが、TabPFN-3.5は非i.i.d.データやマルチモーダルデータにも対応しつつ精度・速度の両面で既存手法を凌駕するとされる。推論速度の大幅改善は、リアルタイム業務処理への適用可能性を高める点で実務的な意義が大きい。
日本企業への示唆
日本企業が保有する売上・物流・顧客属性などの表形式データに対し、より高精度かつ高速な予測モデルを構築できる可能性がある。特に時系列や店舗・部門別グループといった非i.i.d.構造を持つデータへの対応強化は、需要予測や異常検知などの現場課題に直結する。ただし本報告書はarXivプレプリントの段階であり、実装・API提供の詳細は原文では言及されていないため、商用利用の可否や提供形態については今後の公式情報を待つ必要がある。
背景・経緯
TabPFNシリーズはPrior-Fitted Networksの手法を表データに適用した基盤モデルで、今回のTabPFN-3.5はTabPFN-3の後継に当たる。原文によれば、前バージョンTabPFN-3-Thinkingとの比較で推論速度が最大12倍改善されており、モデルの世代が短期間で急速に進化していることが伺える。なお論文はarXivプレプリントであり、査読済み論文ではない。



