公開:2026年9月24日, 最終更新:2026年9月24日
30秒サマリー
- NVIDIAが3D CT解析専用のビジョン言語モデル「NV-Reason-CT」をオープン研究基盤として公開
- 放射線科医の思考プロセスを模倣した「思考の連鎖(Chain-of-Thought)」推論を生成し、CT-RATEベンチマークでSoTAを達成
- NIHの放射線科医が構造化レポートと推論過程の臨床妥当性を検証し、信頼性・監査可能性を評価
何が起きたか
NVIDIAは2026年9月23日付の公式技術ブログで、3D CT画像解析を専門とするビジョン言語モデル(VLM)「NV-Reason-CT」を紹介した。同モデルは研究者・開発者向けのオープン研究基盤として位置づけられており、自律診断システムや規制当局の認可を受けた医療製品ではないと明記されている。
NV-Reason-CTは、3D ViT(ビジョントランスフォーマー)エンコーダとQwen3.5-4Bの言語モデルを組み合わせた構成で、CT画像を192³ボクセルで処理し、空間的連続性を保ったまま13,824個の3D視覚トークンをLLMに入力する。2D画像を積み重ねる従来手法とは異なり、立体的な解剖学的構造を保持した解析が可能。学習は教師あり微調整(約55万件のQA例)と、Group Relative Policy Optimization(GRPO)による強化学習の2段階で行われた。
主要公開ベンチマーク「CT-RATE」では、Macro-F1スコア0.614、Macro-AUROCスコア0.871を達成し、VoxelFM、CT-CLIP、MedGemma 1.5など既存の3D・2D手法を上回り、単一モデルでCT分類とレポート生成を同時に高精度で実現したのは初だとしている。米国立衛生研究所(NIH)の放射線科医Baris Turkbey氏は、モデルの思考過程を確認できることが信頼・活用の前提になると評価している。
なお、胸部X線向けの前モデル「NV-Reason-CXR」を踏まえた発展形であり、NV-Reason-CXRの臨床研究はRSNA 2026で採択されたと原文は述べている。NV-Reason-CTはNVIDIAのセグメンテーションや合成データ生成モデルとの統合も想定されているという。
原典ハイライト
NIHの放射線科医が「モデルの結論だけでなく思考過程を確認できることが、所見を信頼し行動に移せる前提だ」とコメント。CT-RATEベンチマークで既存の3D/2D融合モデルをすべて上回り、分類とレポート生成の同時高精度化は「単一オープンモデルとして初」とNVIDIAは主張している。
出典: NVIDIA Technical Blog(公式ブログ)
So What?(なぜ重要か)
放射線AI最大の課題だった「なぜその診断に至ったか」というブラックボックス問題に対し、放射線科医の思考プロセスを模倣したChain-of-Thought推論が一定の解答を示した。AIの判断根拠を人間が追跡・監査できる構造は、臨床現場への導入障壁を下げる可能性がある。また、研究者がpost-trainingで専門領域に特化できるオープン基盤として提供されている点は、医療AIの多様な応用への間口を広げる。
日本企業への示唆
日本の医療機関・医療AIベンダーにとって、このオープン基盤は3D CT解析AIの内製開発や自施設データによるファインチューニングの起点になりうる。ただし原文が明示するとおり「研究・開発基盤であり、認可医療機器ではない」点には留意が必要で、実臨床への適用には薬機法上の規制対応が別途求められる。一方、推論過程の透明化というアーキテクチャ思想は、AI説明責任を重視する日本の医療・規制環境との親和性が高く、今後の調達評価軸として参照する価値がある。
背景・経緯
放射線AI分野では胸部X線や病理画像向けのVLM開発が先行してきたが、1スタディあたり300〜600スライスに及ぶ3D CT画像は、既存の2D対応モデルでは空間的文脈を再現しきれず、臨床利用には限界があった。NVIDIAは胸部X線向け「NV-Reason-CXR」でChain-of-Thought推論の方法論を確立し、今回その手法を3D CTに拡張した形。学習データにはCT-RATE、NIH CTデータセット、CancerVerseを使用し、大規模言語モデルで蒸留した合成推論データで補完している。




