公開:2026年9月1日, 最終更新:2026年9月1日
30秒サマリー
- DeepSeekがテキスト+視覚理解に対応する実験的モデル「DeepSeek-V4-Flash-Vision-Exp」をHugging Faceで公開した
- マルチモーダルエージェント能力でAnthropicのOpus-4.8に匹敵または上回るベンチマーク結果を示す
- MITライセンスで推論コードも公開され、エンジニアが実装・検証しやすい構成となっている
何が起きたか
DeepSeekは、DeepSeek-V4ファミリー初のマルチモーダル実験モデル「DeepSeek-V4-Flash-Vision-Exp」をHugging Face上で公開した。同モデルはDeepSeek-V4-Flash-0731のアーキテクチャをベースに、視覚モジュールを追加し継続学習を行うことで視覚理解能力を実装したもので、「実験的(Exp)」と位置づけられている。
公開されたベンチマーク結果によると、マルチモーダルエージェント評価指標「ApexBench(Pass@1)」では36.5点を記録し、Anthropicの「Opus-4.8」の39.4点に近い水準を示した。「Agents’ Last Exam」では27.3点と、Opus-4.8の25.7点を上回った。「ZeroBench(Pass@5)」でも35.0点を記録し、Opus-4.8の34.0点をわずかに超えている。一方、テキストのみのエージェントタスクについては、前世代モデルと同等水準を維持しているとされている。
リポジトリにはトークナイザー、プロンプトエンコーディング、最小構成のPyTorch推論実装が含まれ、視覚エンコーダーやMoE(Mixture of Experts)、Hyper-Connectionsなどの主要コンポーネントの参照実装も提供されている。ライセンスはMITで、商用・非商用を問わず利用可能な形態で公開されている。
原典ハイライト
ベンチマーク表において、DeepSeek-V4-Flash-0731はApexBenchおよびAgents’ Last Examでマルチモーダル要素を無視して評価されていた(注釈†)。今回のモデルはその制約を解消し、視覚情報を含むエージェントタスクでOpus-4.8と肩を並べる性能を示した点が核心。
出典: DeepSeek(公式ブログ)
So What?(なぜ重要か)
編集部の見立てでは、今回の公開が示す意義は二重だ。第一に、中国発のオープンモデルがマルチモーダルエージェント領域でトップクラスのクローズドモデルと競合できる水準に到達しつつある点。第二に、MITライセンスかつ推論コード同梱という形式が、企業内での実証実験や独自ファインチューニングの障壁を大幅に下げる点。「実験的」との位置づけからも、本番運用よりは評価・研究フェーズが想定されているが、次世代モデルの性能予測を立てる上での重要な参照点となる。
日本企業への示唆
日本企業が取り得る具体的アクションとして、まずMITライセンスを活かした社内PoC(概念実証)が挙げられる。製造業や金融では図表・帳票・設計図といった視覚情報を含む業務フローが多く、マルチモーダルエージェントとの親和性が高い。「実験的」モデルゆえ本番導入は時期尚早だが、ベンチマーク評価や社内データでの性能検証を今から進めておくことで、正式版リリース時の意思決定を迅速化できる。また、推論コードがオープンなためオンプレミス環境での動作確認も可能であり、データをクラウドに出せない業種にとっては特に検討価値がある。
背景・経緯
DeepSeek-V4-Flashは、テキストベースのエージェントタスクに特化したモデルとしてすでに公開されていた。今回のVision-Exp版はその視覚拡張版に位置づけられるが、「実験的」との名称が示す通り、研究・評価用途を主眼とした公開とみられる。






