公開:2026年9月11日, 最終更新:2026年9月11日
30秒サマリー
- DeepSeekが552Bパラメータ・最大100万トークン対応のマルチモーダルMoEモデル「V4.1-Flash」を公開した
- KVキャッシュを前世代比で約1/4(1トークンあたり890バイト)に圧縮し、エージェント向けコスト効率を大幅改善
- コーディングエージェント系ベンチマーク(DeepSWE v1.1など)では複数の最先端モデルを上回る成績を記録
何が起きたか
DeepSeekはHugging Face上で「DeepSeek-V4.1-Flash」を公開した。同モデルは552Bのバックボーンパラメータを持つマルチモーダルMoE(Mixture-of-Experts)モデルで、最大100万トークンのコンテキストをネイティブに処理し、画像とテキストを統合的に扱う。
最大の技術的特徴はKVキャッシュの大幅圧縮にある。独自の「Causal Encoder-Decoder(CED)」アーキテクチャとCSA2(Compressed Sparse Attention 2)、FP4形式のKVキャッシュ格納を組み合わせることで、1トークンあたりのグローバルKVキャッシュを890バイトまで削減した。これは前世代のDeepSeek-V4-Flashの約1/4、DeepSeek-V1と比べると約1/437という圧縮率だと原文は説明している。また推論時に活性化するパラメータはプリフィル時に8B、デコード時に16Bに抑えられており、入力量の多いエージェントワークロードでのコスト効率化を狙った設計となっている。
事前学習は45兆トークンのマルチモーダルコーパスでゼロから実施。インストラクションモデルでは推論の「深さ」を1〜100の整数で連続的に制御できる機能を備える。ベンチマーク結果では、コーディングエージェント系のDeepSWE v1.1(74.2%、最高スコア)やTerminal-Bench 2.1(90.6%、最高スコア)、AutomationBench(54.8%、最高スコア)などで比較対象の競合モデル群を上回っており、一方でHLE(難問推論)やTerminal-Bench 3.0/4.0ではClaude Opus-5.0等に及ばないベンチマークも存在する。ライセンスはMITライセンスが適用される。
原典ハイライト
原文のコア情報:CED構造とCSA2、FP4 KVキャッシングの組み合わせにより、グローバルKVキャッシュをV4-Flash比で約1/4(890バイト/トークン)に削減。活性化パラメータはプリフィル時8B・デコード時16Bと大幅に抑制。DeepSWE v1.1ではスコア74.2%を記録し、比較対象モデル中最高値となっている。
出典: DeepSeek(公式ブログ)
So What?(なぜ重要か)
編集部分析:KVキャッシュの劇的な圧縮は、長文コンテキストや複数ステップの自律的タスク実行(AIエージェント)を伴うワークロードの推論コストを直接引き下げる。特に入力トークン量が膨大になるコーディングエージェントや文書解析エージェントの実用展開において、これまでコスト面がボトルネックとなっていた企業にとって実装ハードルが下がる可能性がある。MITライセンスでの公開は商用利用も含めた自由度の高い活用を可能にする点でも注目される。
日本企業への示唆
日本企業への示唆(編集部):AIエージェントを社内業務(コード生成・ドキュメント処理・自動化タスク)に組み込む際、推論コストは継続運用コストの主要な変数となる。V4.1-FlashのようにアーキテクチャレベルでKVキャッシュを圧縮し活性化パラメータを絞ったモデルの登場は、大規模エージェント活用の費用対効果の試算を見直す契機となりうる。MITライセンスのためオンプレミス・プライベートクラウドへの自社展開も検討可能であり、データをクラウドAPIに送出したくない業種(金融・医療・製造等)での活用余地を自社の法務・情報セキュリティ部門と改めて確認する価値がある。
背景・経緯
原文から確認できる範囲:DeepSeekはV4-Flash、V4-Proに続くシリーズとしてV4.1-Flashを位置づけており、KVキャッシュ圧縮技術は複数世代にわたって段階的に改善されてきたことがベンチマーク図の説明から示唆される。V1との比較(437倍圧縮)が言及されており、継続的なアーキテクチャ改良の文脈で開発されたモデルとみられる。






