公開:2026年10月8日, 最終更新:2026年10月8日
30秒サマリー
- NVIDIAがNemotron 3を競技プログラミング(IOI)と数学オリンピック(IMO)向けに特化ファインチューニングし、両競技で金メダル水準のスコアを記録した
- SFT・RL・推論ループの組み合わせという「再現可能な特化レシピ」を用い、毎回新たな基盤モデルを開発せずに対応できることを示した
- モデル・学習データ・推論パイプラインをHugging Faceで公開し、外部研究者や企業による応用を促している
何が起きたか
NVIDIAは2026年10月7日付のHugging Face公式ブログで、同社の基盤モデル「Nemotron 3」を競技プログラミング(IOI)と数学オリンピック(IMO)の両分野に特化させた取り組みと結果を詳述した。
IOI 2026では、Nemotron-3-Ultra-CC(総パラメータ数5500億、アクティブパラメータ数550億)をSFTで特化させ、独自の反復的生成・評価・修正戦略「GenCorrect」と組み合わせた結果、600点満点中535.4点を記録。金メダル基準の361.12点はもとより、人間参加者のトップスコア498.27点をも上回った。ただしこの実行は非公式・無監督のベンチマークであり、公式IOIランキングには含まれていない。IMO 2026では、SFTモデルとRLモデルを組み合わせた生成・検証・修正システムを構築し、公式採点者による採点で42点中30点を獲得、公式金メダル基準の29点を超えた。
NVIDIAが強調する「特化レシピ」は4段階で構成される。強力なNemotronベースモデルを起点に、ドメイン固有の問題と高品質な推論トレースを収集・整備し、SFTとRLによる標準的な後学習を施した上で、候補回答を生成・評価・改善する推論ループを組み合わせる、というものだ。IOI向けには2万2000問のキュレーション済み問題セット、IMO向けには41万4890件の品質フィルタ済み証明例が用意された。
NVIDIAはこれらの成果を研究コミュニティへ還元するため、SFT・RLチェックポイント、学習データセット、200問のオリンピックレベルベンチマーク「Nemotron-IMO-Bench」、および推論パイプラインをHugging Faceで公開した。
原典ハイライト
ブログは「新たな基盤モデルを毎回構築する必要はなかった。Nemotronをタスクに特化させた」と明記し、ファインチューニング単体でも、推論時計算量の増大単体でもなく、「モデル・データ・推論ループの協調設計」が金メダル水準の結果をもたらしたと結論づけている。
出典: Hugging Face Blog(公式ブログ)
So What?(なぜ重要か)
世界最高水準の競技で金メダル相当の成果を、新たな基盤モデルの開発なしに「特化レシピ」の適用だけで達成できたことは、基盤モデルの汎用性と特化可能性を同時に実証するものだ。SFT・RL・推論ループという組み合わせは既存の技術スタックで構成されており、再現性が高い点も重要。高度推論が求められるドメイン(法務・医療・研究開発・金融分析など)への応用可能性を示す事例として注目される。
日本企業への示唆
日本企業にとっての示唆は二点ある。第一に、「ドメイン特化モデルを作るには専用基盤モデルが必要」という前提を再考できる。公開されたレシピ(SFT+RL+推論ループ)は標準的な手法の組み合わせであり、自社の専門領域データを持つ企業が自前でドメイン特化モデルを構築するハードルが下がる可能性がある。第二に、NVIDIAがモデル・データ・パイプラインをHugging Faceで公開しているため、まず公開リソースで自社業務への適合性を検証してから投資判断を行うアプローチが現実的だ。特に数理的・論理的推論が業務の中核にある分野(素材研究、財務モデリング、品質管理など)での活用可能性を具体的に検討する価値がある。
背景・経緯
NVIDIAはHugging Faceブログによると、以前にもIOI 2025に向けた取り組みを同ブログで公開しており、当時はテスト時計算量の増加によるオープンウェイトモデルの性能向上を示した。今回のブログはその後続にあたり、ファインチューニングと推論ループの協調設計という新たな知見を追加するものとして位置づけられている。Nemotron 3はNVIDIAの基盤モデルシリーズであり、今回はその「Ultra」および「Nano」バリアントが使用された。




