AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

AllenAI、科学論文レポート生成特化モデル「AstaBrief 8B」をオープンソース化

公開:2026年10月3日, 最終更新:2026年10月3日

30秒サマリー

  • AI2がAstaプラットフォーム向けの科学文献レポート生成モデル「AstaBrief 8B」の重みと学習データを公開
  • 独自モデル比で約3.5倍高速化(平均51秒対179秒)を、SFT+DPOの比較的シンプルな手法で実現
  • 機密研究を扱う機関が自社インフラで動かせるよう、ローカル実行用ワークフロー例も合わせて公開

何が起きたか

Allen Institute for AI(AI2)は2026年10月2日、Hugging Faceの公式ブログで、科学文献を基にした引用付きレポートを生成する専門特化モデル「AstaBrief 8B」のモデル重みと学習データのオープンソース化を発表した。AstaBriefはQwen3-8Bをベースに、実際のAstaユーザーが投稿した研究クエリ9万件をフィルタリングした4万7千件のSFT事例と約6千件のDPOペアで学習されている。学習データ生成にはClaude 3.5/3.7 Sonnet、o3、o4-mini、GPT-4.1、DeepSeek-V3/R1など複数の商用・オープンモデルが使われた。

モデルはAstaの「レポート生成」機能において「Fastモード」として既に稼働中で、Claude搭載の「Thinkingモード」(平均178.5秒)に対しFastモードは平均51.1秒と約3.5倍の高速化を達成している。速度向上の主因は、セクションごとに分割して生成するのではなく、検索した文献スニペットとユーザークエリを受け取ってレポートを一括で生成するアーキテクチャにある。AI2はこの設計により、品質を犠牲にせずに高速化できることを確認したとしている。

学習・評価の大部分は2025年中に完了しており、AI2は「比較対象の商用モデルは当時のフロンティアを反映したものであり、2026年現在の最新モデルとの比較は実施していない」と明記している。評価指標にはルーブリックスコア、回答精度、引用精度、引用再現率の4軸を用い、引用が実際に主張を支持するかという科学的忠実性を重視した。一方でAI2は、文献の主張のスコープを拡大するような微妙な過度な一般化の検出は今後の課題であると認めている。

原典ハイライト

原文では「RL手法は不安定でコストが高いため採用せず、SFT+DPOというシンプルなレシピで商用モデルに匹敵する品質を目指した」と説明。また、LLMジャッジ2モデルの合意率95%を人間との一致基準として、両モデルが合意したペアのみをDPOデータとして採用したことで、スケールドデータ特有のノイズを低減したと述べている。

出典: Hugging Face Blog(公式ブログ)

So What?(なぜ重要か)

編集部の見方として、本件は二つの意味で注目に値する。第一に、大規模RLではなくSFT+DPOの組み合わせで商用モデルに近い品質と大幅な高速化を同時に達成したことは、特定ドメイン向けの小型専門モデル開発の実現可能性を示す実証事例となる。第二に、オープンソース化によって機密性の高い未発表研究を扱う研究機関が自社インフラ内でモデルを運用できる選択肢が生まれる点は、クローズドAPIへの依存リスクを軽減する観点から重要な動向である。

日本企業への示唆

日本の製薬・素材・エネルギー系研究機関や大学の研究推進部門にとって、社外に出せない未公表データを含む文献調査や社内レポート生成にオープンウェイトモデルをオンプレ運用する現実的な選択肢が広がる。自社データ・クエリログを活用したドメイン特化SFT+DPOという手法は、類似の専門レポート生成ユースケース(特許調査、規制文書の要約など)にも転用可能とみられ、AI活用のロードマップ策定において「クラウドAPIか自社運用か」の判断軸を再検討する契機となりうる。

背景・経緯

AI2はAstaという科学研究向けエージェント型プラットフォームを運営しており、ScholarQAフレームワークを基盤にレポート生成機能を提供してきた。今回の取り組みはAI2が参画するNSF主導の全米的オープンAI基盤整備イニシアチブ(NSF OMAI)とも連動している。なお、評価・学習の大部分が2025年中に完了しているという点から、AstaBrief自体の開発は同年から進められてきたとみられるが、公開ブログは2026年10月2日付である。