公開:2026年7月26日, 最終更新:2026年7月26日
30秒サマリー
- AnthropicがClaude Opus 5を2026年7月24日に公開、Frontier-BenchやARC-AGI 3など主要ベンチマークで全モデル中首位を記録
- CursorBench 3.2では最大努力時にFable 5のピークスコアの0.5%以内の性能を半額のタスクコストで実現
- アライメント評価でも同社モデル中最高、欺瞞的挙動の発生率が最低と公式が明言
何が起きたか
Anthropicは2026年7月24日、大規模言語モデル「Claude Opus 5」を正式リリースした。同社の公式ブログによると、Opus 5は前世代「Opus 4.8」より大幅に性能を向上させており、Claude MaxではデフォルトモデルとなりClaude Proでは最上位モデルに位置づけられる。コストについて原文は、CursorBench 3.2において最大努力時でFable 5のピークスコアの0.5%以内の性能を「タスクあたり半額のコスト」で達成したと具体的に記述しており、またOSWorld 2.0ではFable 5の最高スコアをコスト約3分の1強で上回ったとしている。ただし原文の冒頭では「Fable 5のフロンティア知能に半額で接近する」と記されており、全領域で同等の性能を半額で得られるとまでは述べていない。
ベンチマーク面では、ソフトウェアエンジニアリング評価「Frontier-Bench v0.1」で全モデル中首位を記録し、Opus 4.8比でタスクあたりパフォーマンスが2倍超かつより低いコストを実現したと原文は記す。「ARC-AGI 3」(新規問題解決評価)では次点モデルの3倍のスコアを達成。業務自動化ベンチマーク「Zapier AutomationBench」では同コスト帯で次点の約1.5倍の合格率となった。一方、サイバーセキュリティタスクでは「Mythos 5に劣る」と原文は明記している。
科学研究領域でも改善が確認されており、生命科学評価の全項目でOpus 4.8を上回った。特に有機化学(スペクトロスコピーからの分子構造推定)で10.2ポイント、タンパク質配列変異の機能予測で7.7ポイントの向上が内部ベンチマークで報告されている。アライメント評価では、同社の自動行動監査においてOpus 5がOpus 4.8・Sonnet 5・Fable 5を含む同社モデル中で最もClaudeの行動指針への準拠率が高く、欺瞞的挙動の発生率が最低とされた。
早期アクセス顧客からの報告では、金融モデリング業務で「精度平均9ポイント向上、ターン数とツール呼び出しが約3分の1減、処理時間が60%削減」という数値が寄せられた。また法務エージェント業務では最大推論レベルと比較して低い推論レベルでも同等の品質を維持しつつ、Opus 4.8比でトークン数を平均26%削減できたと報告されている。これらは早期アクセス顧客からの個別報告であり、Anthropic公式の保証数値とは異なる点に留意が必要だ。
原典ハイライト
原文では「Frontier-Bench v0.1でOpus 5が全モデルを超え、Opus 4.8のパフォーマンスを低コストで2倍超に引き上げた」「ARC-AGI 3のスコアは次点モデルの3倍」「CursorBench 3.2では最大努力時にFable 5のピークスコアの0.5%以内をタスクあたり半額のコストで実現」と明記されている。アライメントについては「Opus 4.8・Sonnet 5・Fable 5を全て上回り、欺瞞的挙動の発生率が最低」と記されている。早期アクセス顧客からは金融モデリングでの精度9ポイント向上・処理時間60%削減、法務業務でのトークン数26%削減といった個別事例が報告された。
出典: Anthropic News(公式ブログ)
So What?(なぜ重要か)
Opus 5は特定ベンチマーク・特定タスクにおいて、より高い性能をより低いコストで実現できることを示した。CursorBench 3.2やOSWorld 2.0での比較が示すように、用途によってはFable 5相当の出力品質をより低いコストで得られる場面があり、エンタープライズでの大量処理や長時間エージェント運用のコスト構造に影響を与え得る。コーディング支援・業務自動化・金融・法務・ライフサイエンスといった専門領域での実用性が高まり、AIエージェントを本番環境へ展開する判断を後押しする可能性がある。アライメントの改善は、より自律的な業務委任を検討する際の信頼性の根拠にもなり得る。ただしサイバーセキュリティ用途ではMythos 5が上位とされており、用途ごとのモデル選択が重要になる。
日本企業への示唆
日本企業がOpus 5を検討する際、まず注目すべきは「特定タスクにおけるコスト効率の改善」と「長時間自律エージェントへの耐性」の組み合わせだ。金融モデリング・法務レビュー・コードレビューといった高度専門業務で早期アクセス企業が具体的な改善数値を報告しており、これらの領域で既存モデルの評価を進めている日本企業は比較評価のタイミングに来ている。ただし報告数値はあくまで個社の事例であり、自社環境での検証は不可欠だ。サイバーセキュリティタスクでは原文が「Mythos 5に劣る」と明記しており、セキュリティ用途での採用には慎重な評価が必要。製造業・研究機関にとっては有機化学・タンパク質解析の性能向上が実務に直結し得るが、こちらも自社データでの検証が前提となる。AIエージェントを社内システムに接続する場合は、アライメント改善を根拠としつつも段階的な権限付与と人間によるジャッジポイントの設計を維持することが望ましい。
背景・経緯
Claude Opusシリーズは、Anthropicが高性能帯に位置づけてきたフラッグシップライン。原文によると今回の前世代は「Opus 4.8」であり、Opus 5はそこからの直接的な後継となる。同社はFable 5(最上位)・Sonnet 5・Mythos 5など複数モデルを並行展開しており、Opus 5はその中でコーディングや知識労働の主要ベンチマークで最高水準を記録しつつ、Fable 5のフロンティア知能に接近する性能を提供する位置づけとされている。原文ではMythos 5がサイバーセキュリティタスクで優位とも記されており、モデルごとに得意領域が異なる構成となっている。




