10月3日、RuntimeWire Staffが「Ai2 releases an open 8B model for cited science reports」と題した記事を公開した。Allen Institute for AI(Ai2)が科学レポート生成に特化したオープンウェイトモデル「AstaBrief 8B」を公開した。驚くのはその速度だ。引用付きの科学レポート1件を平均51.1秒で生成する。比較対象となるClaudeを使った同社の多段階パイプラインは平均178.5秒かかり、約3.5倍の差がある。モデルウェイトはApache 2.0ライセンスで公開されており、ローカル環境での運用も可能だ。
速度が際立つ:51秒 vs 178秒
AstaBrief 8Bは、研究上の問いと取得済みの科学論文を入力として受け取り、引用付きのレポートを生成するモデルだ。Ai2は同モデルを自社のAstaプラットフォームのFastモードに組み込んで運用している。Astaにはもう一方でClaudeを使った「Thinkingモード」も存在する。
Fastモードは平均51.1秒でレポートを1件生成するのに対し、ThinkingモードのClaudeパイプラインは平均178.5秒かかる。約3.5倍の差になる。
この速度差は設計の違いから来る。Fastモードは質問と取得済みの引用テキストを受け取り、レポートを一発で生成するワンパス方式だ。一方、Thinkingモードは引用テキストの要約・クラスタリングを経てから章ごとに書き進める多段階方式を採る。AstaBriefはレポート生成のみを担い、文献取得はその上流で行われる。
訓練構成:SFT+DPOで強化学習を使わない選択
AstaBriefのベースモデルはQwen3-8Bだ。訓練手法にはSupervised Fine-Tuning(SFT)とDirect Preference Optimization(DPO)を使い、強化学習は採用していない。Ai2が理由として挙げたのはコストとデバッグのしやすさであり、「訓練レシピをシンプルに保ち、データ品質に仕事をさせる」という考え方だ。
訓練データの構築手順は以下の通り:
- ユーザーログからフィルタリングした90,000件の研究向きクエリを起点とする
- 複数の独自モデル(Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini、GPT-4.1)でレポート候補を生成し、47,000件をSFT用に選別
- DPO用の選好データには約6,000件のレポートペアを使用。2つのジャッジモデルが一致した例のみを採用
つまり、オープンウェイトモデルでありながら、訓練データの一部はクローズドモデルの出力から生成されている。「プロプライエタリモデルを教師にして、オープンモデルを鍛える」アプローチは珍しくないが、Claude・GPT-4.1・o3といったモデルの出力を学習データとして利用する場合、各モデルの利用規約がその用途を制限している可能性がある点には留意が必要だ。Ai2はこの点について公開記事上で個別の言及を行っていないため、利用規約との整合性を自身で確認したい読者は各モデルのポリシーを参照することを勧める。
何が公開されているか
Ai2が今回公開したのは以下の3点だ:
- モデルウェイト(Apache 2.0ライセンス): HuggingFace
- DPOデータセット: AstaBrief DPO Mix
- ローカルPDF向けのワークフロー例: GitHub (ai2-scholarqa-lib)
ローカルPDFワークフローの公開は、未発表の研究や機密性の高い論文を扱う研究機関にとって意味を持つ。プロプライエタリなモデルAPIにレポート生成リクエストを送らずに済む自前インフラで動かせる構成だ。
評価指標と現時点の限界
公開されている評価は、コンピュータサイエンス分野の100問から成るScholarQA-CS2テストセットを使ったもので、以下のスコアを記録した:
- 総合スコア:87
- 引用精度(Citation Precision):90.5
- 引用再現率(Citation Recall):78.2
ただしAi2自身が注記しているように、訓練・評価の大半は2025年に行われたものであり、2026年時点の最新フロンティアモデルとの比較は再実施していない。現時点ではこれらのスコアを「今の最強モデルとの比較結果」として読むのは適切でない。
さらに根本的な問題として、引用が付いていること自体は品質保証にならない。引用された論文の主張を誇張したり、サンプルの範囲を超えて一般化したりするリスクは別の話だ。Ai2もこの点を認識しており、「エビデンスの強さと適用範囲を正しく保持する評価手法の整備が必要」と述べている。
Asta上での実ユーザーデータとしては、Fastモードを試した374人のうち29.1%が2日以上使用し、23%がThinkingモードに戻らずFastモードを継続した。肯定的フィードバック率はFastが84.2%、Thinkingが85.2%だったが、Ai2はフィードバック数が少なく強い結論は出せないとしている。
Ai2のオープン戦略との文脈
AstaBriefの公開は、Ai2が前日(10月1日)に発表したOlmoトレーニングスタックの一部公開と同じ方向性を持つ。Paul Allenが2014年にAi2を設立した際に掲げた「科学的AIをオープンに」という組織方針の延長線上にあり(Allenは2018年に逝去しているが、その理念は現在も組織の根幹をなす)、今回はその対象をより狭い「科学レポート生成」というワークフロー層に絞っている。
研究機関にとって実用的な価値は、デプロイの自由度とモデルの検査・改良可能性にある。ただし、そのオープン性が実際に信頼できるレポートを生み出すかどうかは、Ai2のテスト範囲を超えた評価によって検証されなければならない。
詳細はAi2 releases an open 8B model for cited science reportsを参照していただきたい。