30秒サマリー
- AWSがAmazon Bedrock Data Automationを活用したPII(個人情報)自動墨消しパイプラインの構築手法を公式ブログで詳説
- カスタムブループリントと標準出力のトークンマッチングを組み合わせ、精度97%・再現率95%を達成
- 医療フォームや保険請求書など劣化したスキャン文書でも高精度に機能することをテストで確認
何が起きたか
AWSは公式機械学習ブログにて、Amazon Bedrock Data Automation(BDA)、AWS Step Functions、AWS Lambdaを組み合わせたサーバーレスのPII墨消しパイプラインの構築方法を解説した。対象は医療フォーム・保険請求書・財務記録など大量のスキャン文書を日常的に扱う組織で、従来のOCR+パターンマッチング方式の限界(文字劣化への脆弱性、カスタムMLモデルの再学習コスト等)を解決する手法として提示されている。
ソリューションの中核は「カスタムブループリント」の設計だ。自然言語の指示文でどのフィールドを墨消し対象とするかを宣言し、BDAがページ全体のレイアウト・フィールドラベル・文脈を解釈して対象情報のバウンディングボックス座標を返す。ブログでは「担当医師の診断書(Attending Physician Statement)」を具体例として用い、患者名・生年月日・住所・連絡先を墨消し対象とし、医師名・診察日・院内連絡先は対象外とする37フィールド・9フィールドグループ構成のブループリントを紹介している。
精度評価では、クリーンな印刷フォームから100DPIの低解像度スキャンまで6段階の品質レベルを設定し、12文書(47ページ)を人手による墨消しと比較した。ブループリント単独では精度97.0%・再現率89.3%だったが、BDA標準出力のトークンマッチング(1回のAPIコールで同時取得可能)を組み合わせることで、精度96.5%・再現率95.2%に向上した。この手法により、自由記述の段落や手書きメモに繰り返し登場するPIIの見落としを追加レイテンシなしで補完できるとしている。
原典ハイライト
ブループリント単独では再現率89.3%にとどまったが、BDA標準出力とのトークンマッチングを1回のAPIコールで組み合わせることで95.2%に引き上げ、精度はほぼ維持(97.0%→96.5%)。手書き・低解像度を含む6段階の文書品質すべてで動作を確認した点がポイント。
出典: AWS Machine Learning Blog(公式ブログ)
So What?(なぜ重要か)
従来、PII墨消しは人手またはOCR+パターンマッチングで行われており、文書品質の劣化や多様なフォーマットへの対応がボトルネックだった。BDAのカスタムブループリントを使えば、MLの専門知識なしに自然言語の指示だけで墨消し対象を定義でき、手書きや劣化文書にも対応可能となる。さらにサーバーレス構成のためスケールアウトも容易で、コンプライアンス対応の自動化コストを大幅に削減できる可能性がある。
日本企業への示唆
金融・医療・保険など個人情報を大量に扱う日本企業にとって、帳票や診断書のデジタル化・三者共有時のPII処理は実務上の課題だ。本手法はAWS環境があれば比較的短期間で導入を検討できる構成であり、まずは社内の特定ドキュメント種別でブループリント設計とPoC評価を行うことが現実的な第一歩となる。なお原文ではブループリント設計には「反復的な実験」が必要と明記されており、初期導入に一定の検証工数を見込む必要がある。個人情報保護法対応の文書処理フローを持つ企業は、本アーキテクチャのセキュリティ要件(S3暗号化、IAMポリシー等)もあわせて精査することが求められる。
背景・経緯
Amazon Bedrock Data Automationは、非構造化文書・画像・音声・動画から構造化情報をインテリジェントに抽出するAmazon Bedrockのサービス機能。ブログではカスタムブループリントと標準出力の2出力を1APIコールで取得できる点、およびコンソール・CLI・SDKからブループリントを作成できる点が説明されている。サービス自体の提供開始時期については原文では言及がない。






