AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

自然言語でSQL生成、複雑な企業DBで正答率91.7%達成——arXiv論文

30秒サマリー

  • 複雑に入れ子構造を持つ企業DBへのNL-to-SQLで91.7%の正答率を達成した新アーキテクチャを提案
  • 既存の最良ベースラインを54.6ポイント上回り、コスト効率も重視した設計が特徴
  • 900件の検証済みクエリを含む新ベンチマーク「DevRev NL2SQL」も合わせて公開

何が起きたか

2026年9月4日、Yoga Sri Varshan Varadharajanら8名の研究者がarXiv(cs.AI)に論文「A Cost-Aware Agentic Architecture for NL-to-SQL over Nested Enterprise Schemas, with a New Benchmark」を投稿した。

論文は二つの貢献を提示している。第一に、「DevRev NL2SQL」ベンチマークの構築だ。900件の実行検証済みクエリで構成され、グラフ構造・半構造化・深い入れ子構造を持つ企業スキーマを対象とする。既存の学術ベンチマークではこうした複雑な構造が十分に評価されていないという課題意識に基づく。また、スキーマに依存しない分析推論深度の指標として「Semantic Depth Score(SDS)」も導入している。

第二に、「コストを考慮したシングルジェネレーション型エージェントアーキテクチャ」を提案している。スキーマ選択・メタデータ取得・エラー修復の各コンポーネントが、複雑な企業スキーマの要件に対応するよう設計されている。DevRev NL2SQLベンチマーク上での正答率は91.7%に達し、次点のベースラインを54.6ポイント上回ったと報告している。公開ベンチマークであるSpider 2.0 Snowflakeデータセットでも、シングルジェネレーション動作点において主要システムと競合する水準であるとしている。

原典ハイライト

論文アブストラクトによれば、既存の学術ベンチマークは企業現場で見られるグラフ状・半構造化・深い入れ子構造のスキーマを十分に測定できていない。提案システムはDevRev NL2SQLベンチマークで91.7%の正答率を達成し、次善のベースラインに対して54.6ポイントのリードを記録した。

出典: arXiv cs.AI(論文)

So What?(なぜ重要か)

NL-to-SQLの精度向上は、非エンジニアが自然言語で社内データを直接照会できる環境の実用化に直結する。特に今回の研究が注目されるのは、単純なテーブル構造ではなく「実際の企業データベース」に近い複雑な入れ子構造を対象としている点だ。コスト効率を設計思想に組み込んでいる点も、商用展開を見据えた実用性の高さを示唆する。ただし、本論文はプレプリント段階であり、査読を経た評価は今後となる。

日本企業への示唆

社内のBIツールやデータ活用基盤にNL-to-SQL機能を導入・評価している日本企業にとって、精度評価の基準として「DevRev NL2SQLベンチマーク」とSDSスコアの動向を注視する価値がある。自社の基幹DBが複雑な入れ子・リンク構造を持つ場合、一般的な学術ベンチマーク上の高スコアが実務精度を保証しないことも改めて確認できる。PoC段階でのベンチマーク選定を見直す契機にしたい。

背景・経緯

NL-to-SQL技術はSpiderやBird等の学術ベンチマークで急速に精度が向上してきたが、実際の企業データベースはこれらとは異なるグラフ状・半構造化・深い入れ子構造を持つことが多く、学術的な高スコアが現場での有効性を直接意味しないという問題が指摘されてきた。本論文はこのギャップを埋めるベンチマークとアーキテクチャの両面から取り組んだものとみられる。