公開:2026年10月3日, 最終更新:2026年10月3日
30秒サマリー
- NII主導のLLM-jpプロジェクトが、日本語特化LLMシリーズの新バージョン「LLM-jp-4.1」を公開した
- 8B・33B・32B-A3B(MoE)の3モデルに加え、SFTおよびDPOの学習データセットも同時公開
- STEM分野の性能向上、回答の簡潔化、Tool Calling機能の追加が主な改善点
何が起きたか
国立情報学研究所(NII)が主導するLLM-jpプロジェクトは2026年9月28日、日本語特化の大規模言語モデル「LLM-jp-4.1」シリーズをHugging Face上で公開した。公開されたのはチューニング済みモデル(8B・33B・32B-A3B)とその量子化版(GGUF形式)、および事後学習に使用したSFTデータ・DPOデータのデータセット群である。
主な改善点は3点。第一に、NVIDIAのNemotronシリーズなどSTEM系データセットの使用量を前バージョン比で最大約15倍に拡大し、数学・科学分野の性能を強化した。第二に、ツール呼び出し(Tool Calling)機能を新たに追加。NVIDIAが公開するエージェント系データセットを加工・日本語翻訳して学習に活用した。第三に、前バージョンで指摘されていた回答の冗長さを改善するため、SFTデータ生成時に簡潔な回答を促す指示をシステムに組み込み、一部カテゴリで回答トークン数を半分程度に削減した。
事後学習の規模もLLM-jp-4から大幅に拡大しており、総学習量は約35Bトークンと前バージョンの約3倍に達した。学習にはNVIDIA H200 SXM5を搭載したノードを最大16台使用し、33Bモデルでは約67時間を要した。評価結果では、33Bモデルがolmo-3.1-32B-ThinkやQwen3-32Bを上回る平均スコアを記録したと報告されている。一方でMathやScienceカテゴリには依然として改善余地があると開発チームは認めている。
なお、教師モデル(gpt-oss-120b)の自己言及が学習データに混入する問題(「私はChatGPTです」などの表現)への対処として、自己言及フィルターを導入した。ただし現行のフィルター設計にはトレードオフが存在することが確認されており、今後の改善を予定していると原文は述べている。
原典ハイライト
llm-jp-4.1-33b-thinkingはswallow-evaluation-instructによる評価でOlmo-3.1-32B-ThinkとQwen3-32Bを上回り、gpt-oss-120bとほぼ同等のスコアを記録。SFTデータ・DPOデータも同時公開し、学習の再現性と透明性を確保している点が特徴的。
出典: llm-jp.nii.ac.jp
So What?(なぜ重要か)
日本語に強いオープンウェイトLLMが、STEM推論・エージェント的ツール呼び出し・簡潔な応答という実務上の要求水準に近づいてきた。学習データも公開されているため、研究機関や企業が独自ファインチューニングや改良を加えやすい環境が整いつつある。商用クローズドモデルに依存しない日本語AI基盤の選択肢として現実味が増している。
日本企業への示唆
日本語業務への適用を検討する企業にとって、オープンウェイトかつ日本語特化モデルの性能が商用モデルに近づいていることは、コスト・データ主権・カスタマイズ自由度の観点で選択肢の幅を広げる。特にTool Calling機能の追加により、社内APIや業務システムと連携するエージェント型アプリケーションへの活用が技術的に現実的になった。SFT・DPOデータが公開されているため、自社ドメインデータでの追加学習を検討する際の参照基盤としても活用できる。一方で、数学・コードカテゴリの性能や自己認識フィルターの不完全さなど既知の課題も開発チームが明示しており、PoC段階での十分な評価が引き続き必要である。
背景・経緯
LLM-jpは国立情報学研究所が主導する日本語LLM開発プロジェクト。2026年4月以降、llm-jp-corpus v4およびv4.1を用いた「LLM-jp-4」シリーズとして8B・33B・32B-A3B(MoE)の3モデルを順次公開してきた。今回のLLM-jp-4.1はその事後学習を改善したアップデート版にあたる。





