公開:2026年9月23日, 最終更新:2026年9月23日
30秒サマリー
- Epoch AI等の研究者が68のエルデシュ未解決問題でAIを評価するベンチマーク「FME」を発表
- 評価した5モデルのうちGPT-6 Astraが3%を記録し、残る4モデルはすべてスコア0%
- 現時点のAIは、人間の数学者が未解決とする問題の体系的な証明にはほぼ対応できないことが示された
何が起きたか
Epoch AIのTom Adamczewskiとマンチェスター大学のThomas F. Bloomは2026年9月、論文「FrontierMath Erdős(FME)」をarXivに投稿した。FMEは、2026年8月時点で未解決とされる68のエルデシュ予想を収録したベンチマークであり、AIシステムはこれらの予想を証明補助ツール「Lean」上で証明または反証することで評価される。
68問はBloom氏が652件の未解決問題リストから数学的な興味と難易度を基準に選定した。評価は各AIモデルを同一問題・同一予算(1問あたり300ドル)・自律実行の条件下で行うことで、公平な比較を可能にする設計となっている。
評価対象となった5つのAIモデルのうち、GPT-6 Astraが3%(68問中約2問に相当)を記録した一方、残りの4モデルはすべて0%だった。著者らは、AIが近年いくつかの未解決数学問題を解いた事例はあるものの、それらは体系的なAI能力の評価には至っていないと指摘しており、FMEがその空白を埋めることを目指している。
原典ハイライト
論文アブストラクトは「AIは最近いくつかの未解決数学問題を解いたが、それらはAI能力の体系的な研究には不十分」と明記し、FMEが固定問題・同一予算・自律実行という統一条件でAIを評価する初の枠組みであると位置づけている。
出典: arXiv cs.CL(論文)
So What?(なぜ重要か)
現時点の最先端AIでさえ、数学の最前線に位置する未解決予想のほぼすべてを解けないことが、体系的な手法で定量化された。AI数学能力の「天井」がどこにあるかを示す客観的指標が初めて整備されたことで、今後の進歩を測るベースラインが確立されたと言える。一方、GPT-6 Astraが3%を記録したことは、ゼロではない突破口があることも示しており、研究の焦点が「解けるか否か」から「どの問題クラスで進展が起きるか」に移行する可能性がある。
日本企業への示唆
AIの数学・論理推論能力を研究開発・製品選定に活用しようとする日本企業にとって、現行AIが「オープンエンドの未解決問題」には事実上対応できないことを改めて認識しておく必要がある。証明支援ツール(Leanなど)と組み合わせた形式検証や数理最適化への応用は今後の有望分野だが、人間の専門家の代替としてAIを位置づけるのは時期尚早であることをFMEの結果は示している。経営判断においては、AIを「補助ツール」として活用しつつ、高度な数理的意思決定には引き続き専門人材の確保・育成が不可欠と言えるだろう。
背景・経緯
エルデシュ問題とは、20世紀の著名な数学者ポール・エルデシュが提起した未解決予想群を指す。組合せ論・整数論など幅広い分野に及び、懸賞金付きの問題も多い。近年、AIが既存の未解決問題を解いた事例(原文では具体的な事例の詳細は記述されていない)が注目を集めているが、それらが個別事例にとどまっていたため、体系的な評価の必要性が高まっていた。FMEはそうした背景から設計されたベンチマークとみられる。



