AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

職種別LLM評価フレームワーク「ORQA」:医療78%・事務40%の性能差を実証

公開:2026年9月14日, 最終更新:2026年9月14日

30秒サマリー

  • LLMの職種別専門知識を実務レベルで評価するフレームワーク「ORQA」をarXiv論文が提案
  • 最上位モデルでも正答率58〜62%にとどまり、職種間で大きな性能格差が判明
  • 医療系職種は78%と高い一方、特定職種ではほぼ0%と、AI導入適性に明確な差

何が起きたか

カリフォルニア大学バークレー校などの研究者3名(Shreyas Krishnan、Serina Chang、Abhishek Nagaraj)は2026年9月、大規模言語モデル(LLM)の職種レベルの専門知識を評価するフレームワーク「ORQA(Occupation-Realistic Question and Answer Framework)」を提案するarXiv論文を公開した。

ORQAは、米国労働省のO*NETが定義する職業分類と、規制機関・資格認定機関・政府刊行物などの信頼性の高い職種別ウェブサイトを紐づけ、出典追跡可能なQ&Aペアを自動生成・人手レビューの組み合わせで構築する手法を採用。SOC(標準職業分類)の全21大分類から116職種をカバーし、187サイトから480問を収録する。

15種類の最先端フロンティア・オープンウェイトモデルを評価した結果、Claude Opus 4.6、GPT-5.4、Claude Sonnet 4.6が約58〜62%の正答率でトップ集団を形成。一方、小規模オープンウェイトモデルは約33〜41%にとどまった。職種別では医療系が最高の78%を記録したのに対し、事務・行政サポート系は約40%、板金工や野生動物保護官などの特定職種ではほぼ0%という結果が出た。また、自由記述形式の設問導入や賃金総額による重み付けを行っても、モデルの順位付けに有意な影響はなかったと論文は報告している。

原典ハイライト

最高性能のモデル群でも職種横断の正答率は58〜62%に過ぎず、医療系(78%)と特定の現場系職種(ほぼ0%)の間には決定的な差がある。ORQAはO*NETと公的・専門機関サイトを組み合わせることで、専門家による問題作成コストを抑えながらスケーラブルな評価を実現する点に新規性がある。

出典: arXiv cs.CL(論文)

So What?(なぜ重要か)

「AIは万能」という前提での業務導入には大きなリスクがある。本研究は、LLMの職種別専門知識に明確な性能上限と分野格差があることをベンチマークで可視化した点で重要だ。最高クラスのモデルでも正答率が6割程度にとどまる事実は、専門判断を完全にAIに委ねるリスクを示唆する。一方、医療系の高スコアは、医療分野でのAI支援ツールの有効性を裏付ける材料にもなり得る。

日本企業への示唆

日本企業が業務特化型AIの導入を検討する際、「職種・業務ドメインごとの性能検証」を省略することはリスクになる。ORQAのアプローチ(業界団体・資格機関・法令情報などを問題源にする)は、日本の職種環境に合わせた独自評価基準の設計にも応用できる。特に医療・法務・建設・公務など専門資格が存在する領域では、モデルの性能が職種によって極端にばらつく可能性を前提に、パイロット導入での実測評価を組み込むべきだ。事務・管理系でも正答率40%程度という結果は、ホワイトカラー業務へのAI全面委任に慎重さが求められることを示している。

背景・経緯

LLMの能力評価は従来、一般的なベンチマーク(MMLUなど)や抽象的なスキルマッピングが主流だった。ORQAはこれを補完する手法として、O*NETという公的な職業情報データベースと職種固有の一次情報源を組み合わせることで、実務に即した評価の実現を目指している。専門家による問題作成は高コストかつスケールしにくいという課題への対応策として位置づけられる。