30秒サマリー
- AI・認知科学の研究者らが、人間とAIの認知行動を体系的に比較する統一フレームワーク「CogGym」を論文で発表
- 258の認知実験・50の大規模言語モデルを評価した結果、最良モデルでも人間の判断との一致度はR²=0.59止まり
- 数学・コーディングなど形式的推論の向上速度に比べ、常識推論での人間との乖離解消は著しく遅い
何が起きたか
マサチューセッツ工科大学やスタンフォード大学など複数機関の研究者56名が共同執筆した論文「CogGym」が2026年9月18日、arXivに投稿された。論文は、人間とAIモデルの認知行動を大規模かつ再現可能な形で比較するフレームワークの構築を提案している。
CogGymは「Experiment Markup Language(EML)」と呼ぶタスク非依存の共通記述形式を用い、多様な実験パラダイムを標準化する半自動・人間介在型パイプラインを採用する。初期リリースでは、常識推論に関する100本の論文から258の認知実験を整備し、50の大規模言語モデル(LLM)を人間の応答と比較評価した。
評価の結果、モデルが大規模化・新世代化するほど人間の判断を再現しやすくなるスケーリング傾向が確認された。一方、最良モデルでもテキスト実験でR²=0.59、画像で0.58、動画で0.43にとどまり、人間同士の応答一致度(テキスト0.93、画像0.95、動画0.92)と比較して大きな差が残る。また、数学やコーディングといった形式的推論ベンチマークでの改善速度と比べ、常識推論における人間との乖離解消は顕著に遅いことも示された。
研究チームはCogGymを「生きた評価基盤」として継続的に新たな認知科学実験を追加していく方針を示している。
原典ハイライト
最良のLLMでも人間の常識推論への適合度はR²=0.43〜0.59にとどまり、人間同士の一致度(0.92〜0.95)を大きく下回る。数学・コーディングでの急速な進歩とは対照的に、常識推論での人間との差は縮まりにくいことが定量的に示された。
出典: arXiv cs.AI(論文)
So What?(なぜ重要か)
AIが形式的タスクで急速に人間を超えていく一方、「人間らしい常識推論」との乖離は依然として大きく、構造的な違いがあることが定量的に裏付けられた。AIの能力を過信せず、用途に応じた特性の違いを把握することが重要になる。
日本企業への示唆
経営・業務判断にAIを活用する日本企業にとって、本研究は「AIが得意な領域と不得意な領域」を見極める参照点になりうる。数値計算・コード生成・定型推論ではAIは高い精度を発揮するが、文脈依存の常識判断や人間的なニュアンスが求められる意思決定では依然として人間の関与が不可欠であることを示す。導入検討の際には、用途ごとにAIと人間の役割分担を精緻に設計することが求められる。
背景・経緯
AIと認知科学はともに「知性のモデル化」を目標に掲げてきたが、両分野の比較評価は実験設定のばらつきや規模の制約から体系化が難しかった。CogGymはこの課題に対し、標準化された記述形式と半自動パイプラインで大規模比較を可能にする枠組みとして提案された。



