公開:2026年9月15日, 最終更新:2026年9月15日
30秒サマリー
- 数万規則を持つ実務マニュアルへのLLMの適用を評価した新ベンチマーク「TAM」が公開された
- GPT-5を用いた検証でも完全一致の正答率はICD-10コーディングで1%、量刑計算で15.5%にとどまった
- 既存ベンチマークはLLMの推論能力を過大評価しており、長大なルール体系への対応力は依然として不足している
何が起きたか
米国の研究者グループ(Utkarsh Soniら5名)は2026年9月11日、大規模言語モデル(LLM)の「長期手続き的推論」能力を評価するベンチマーク「TAM(Tasks over Application Manuals)」をarXivに発表した。TAMは実世界の二つのドメイン、すなわちICD-10-CM臨床コーディング(病名を診断コードへマッピングする作業)と米国連邦量刑基準(犯罪の量刑レベルを算出する作業)から構成される。いずれのタスクも数万に及ぶルールを収録した公式マニュアルを参照しながら、複数セクションにまたがる相互依存した手順を順番に実行し、正確な答えを導き出す必要がある。
研究チームはGPT-5を対象に、検索拡張生成(RAG)、ReActスタイルのプロンプティング、エージェントハーネスベースラインという複数のアプローチを評価した。その結果、いずれの手法でも完全一致による正答率は著しく低く、ICD-10-CMコーディングでは1%、量刑タスクでは15.5%にとどまった。
論文はこの結果を踏まえ、従来のベンチマークが「少ないステップ数で完結する短期的な推論」のみを評価しており、LLMの実能力を過大評価している可能性を指摘している。現実の業務で求められる「長大かつルールベースの手順を確実に遵守する能力」は、現行のLLMにとって依然として重大な課題であると結論づけている。なお、TAMのデータとコードは公開されている。
原典ハイライト
GPT-5に対しRAG・ReAct・エージェントハーネスを含む複数の最先端手法を適用しても、ICD-10コーディングの完全一致正答率は1%、連邦量刑計算では15.5%。数万規則を持つ実務マニュアルへの長期手続き的推論は現行LLMの明確な弱点であることが定量的に示された。
出典: arXiv cs.CL(論文)
So What?(なぜ重要か)
LLMが短文Q&Aや汎用推論で高スコアを出せるようになった一方で、企業内の複雑な業務規程・法令・マニュアルへの「確実な準拠」という実務上の要件には根本的な能力ギャップが存在することが改めて裏付けられた。RAGやエージェント構成を採用しても解決できない点が示されており、LLM自動化を業務判断に直結させるアプローチは現時点で高リスクといえる。
日本企業への示唆
社内規程や業務マニュアルをLLMに処理させる際には、正答率が想定より大幅に低くなるリスクを前提に設計すべきである。具体的には、①高リスク判断(法令遵守・コンプライアンス判断等)へのLLM単独適用は避け、人間によるレビューを必ず挟む、②RAGやエージェント構成を導入しても精度が劇的に向上するわけではないことを念頭に置いてPoC目標値を設定する、③LLMを「全手順の自動実行」ではなく「関連条項の参照支援」や「ドラフト生成」に限定した役割設計を検討する、といった対策が現実的な対応となる。
背景・経緯
LLMの推論能力を測る既存ベンチマークの多くは、数ステップで完結する比較的短いタスクで構成されている。一方、実務では税務・医療・法務・コンプライアンスなど、数百ページに及ぶ複雑で相互依存したルール群に従った長期的な手続き処理が求められる場面が多い。本研究はこのギャップを埋めるベンチマークを整備し、定量的に課題を示した点に意義がある。



