公開:2026年9月30日, 最終更新:2026年9月30日
30秒サマリー
- RAGは単一文書の検索に有効だが、数百件の契約書を横断した集計・合計には構造的に対応できない
- AWSはClaude Sonnet(抽出)とClaude Haiku(検証)の二モデル構成+Amazon Textractによる第三者判定で精度を担保する設計を紹介
- 構造化データはAurora PostgreSQL+Amazon Quickで集計・可視化し、原文書はRAGで参照する「二刀流アーキテクチャ」を提案
何が起きたか
AWSのMachine Learning公式ブログが、Amazon BedrockおよびAmazon Bedrock AgentCoreを活用した契約書インテリジェンス・プラットフォームの構成例を解説した。
記事の中核にあるのは、RAG(Retrieval Augmented Generation)の本質的な限界の指摘だ。RAGは文書をチャンク化してベクトルインデックスに格納し、質問に対してtop-kの類似チャンクだけを返す仕組みのため、「全250件の契約書の合計金額は?」「期限切れの契約はどれか?」といった集計・横断型の問いには原理的に答えられない。より良いプロンプトでは解決できず、アーキテクチャ自体を変える必要があると明示している。
提案アーキテクチャは以下のように構成される。S3に格納されたPDFは、Strands Agent SDKとAgentCore Runtimeで動作するAIエージェントが処理する。Claude Sonnet 4.6がPDFから8フィールドを信頼スコア付きのJSON形式で抽出し、Claude Haiku 4.5が同一文書を独立して検証する二重モデル方式を採用。両エージェントが署名の有無で判断が食い違った場合に限り、Amazon Textractのコンピュータビジョン機能が決定的な第三者判断を下す。抽出・検証済みのデータはAurora PostgreSQLに格納される。クエリ層ではAmazon Quickが集計ダッシュボードと自然言語チャットを提供し、単一文書の詳細はRAGが参照するという役割分担を実現している。
ブログでは20件の契約書を使ったモデル選定の評価も紹介されており、抽出モデルの能力が精度への影響が大きく、検証モデルは軽量モデルでも十分な精度を維持できた傾向があったとしている。ただし「小規模で方向性を確認するためのテストであり、自社データで必ず再評価すること」と注意書きも付けている。
原典ハイライト
「より良いプロンプトでは解決しない。異なるアーキテクチャが必要だ(A better prompt won’t fix this. A different architecture will.)」——RAGの限界を構造的問題として明確に定義し、構造化抽出+集計DBという代替設計を提示したことが記事の核心。
出典: AWS Machine Learning Blog(公式ブログ)
So What?(なぜ重要か)
社内に大量の非構造化文書(契約書、仕様書、報告書など)を抱える企業がAIチャット導入後に「集計・横断検索ができない」と壁にぶつかるのは、ツールの品質の問題ではなくRAG自体の設計限界に起因する。本記事はその問題に対し、構造化抽出→DB格納→分析ツールという「二刀流アーキテクチャ」が解答になることを実装レベルで示した。二モデル検証+第三者サービスによるハイブリッド精度保証の設計パターンは、契約書以外の文書処理にも転用可能な汎用性を持つ。
日本企業への示唆
日本企業が契約管理・稟議書・法令対応文書などをAIで活用しようとする際、まず「その問いが集計型か単一参照型か」を切り分ける設計思想が必須になる。既存のRAGベースの社内検索ツールをそのまま拡張しても、ポートフォリオ全体の集計・期限管理・リスク集計には答えられない。本記事のアーキテクチャ設計(抽出→構造化DB→分析+RAG併用)をPoC段階から意識し、データ基盤整備とAI活用を一体設計で進めることが有効。また、二モデル検証による精度保証パターンは、契約金額や法的条件のように誤りが損失に直結する業務への適用時に参考になる。
背景・経緯
原文によれば、このソリューションはAmazon Bedrock AgentCore(AgentCore Runtimeおよびポリシー機能を含む)とStrands Agent SDK(オープンソース)、Amazon Quick(QuickSightのダッシュボード機能を含む)を組み合わせた構成。原文では各サービスの新規リリースを告知しているわけではなく、これらのサービスを組み合わせた実装パターンの解説記事として公開されたもの。使用モデルはClaude Sonnet 4.6およびClaude Haiku 4.5と明記されているが、原文はモデルの選択肢は変わり得るとして再評価を推奨している。




