Ai2は10月2日、Astaの「レポートを作成」機能で ファストモード を支えるモデルとして、AstaBrief 8Bを公開した。ダウンロード可能なこのモデルは、研究上の問いと学術論文から検索した抜粋を受け取り、一度の生成で引用付きレポートを作成する。研究者にとって重要なのは、論文がどこから得られるのか、そして引用が実際に何を裏付けているかだ。AstaBriefは与えられた証拠に基づいて文章を作るモデルであり、それ自体が文献検索サービスというわけではない。 Ai2の発表 と モデルカード は、この役割の境界を説明している。
大きな変化
- 何が変わったか: Ai2はAstaのライブ版「ファストモード」にAstaBriefを導入し、モデルのウェイトと学習資料を公開した。
- なぜ重要か: Ai2によると、研究グループはレポート生成モデルを調査・改変したり、オープンウェイトモデルを自らのインフラで実行したりできる。
- 今後の注目点: レポートの品質は検索された文献に左右され、重要な主張は一つずつ出典と照合する必要がある。Astaが提供するClaude搭載の「シンキングモード」は、これとは別の多段階処理オプションだ。
問いからレポート作成まで
ホスト版では、Astaの レポートを作成機能から始める。「ファストモード」ではAstaBriefが使われる。Ai2によると、レポート作成システムは関連文献を検索したうえで、問いと抜粋をモデルに渡す。モデルはその内容から一度でレポートを作成する。「シンキングモード」で行う引用箇所の抽出、クラスタリング、節ごとの執筆は省かれる。 公開されているScholarQAリポジトリ では、Semantic Scholarの文章検索とキーワード検索による取得と、その後の再ランキングが説明されている。 簡易実装 では、再ランキング済みの文献からプロンプトを組み立て、設定された生成モデルを呼び出す。これらは公開資料に記載された構成要素であり、BIG CHANGEが実際のAstaサービスをテストした結果ではない。
ダウンロードして使う場合、 AstaBriefのモデルカード は、推奨プロンプト形式と、問いおよび各節の参考文献を含む入力を案内し、 transformers/vLLM の推論コード例を掲載しており、最大出力トークン数は4,096。カードのコード例では model_name SFTチェックポイント が指定されている一方、同じページの説明では、後からDPOで調整されたチェックポイント AstaBrief_8Bが紹介されている。研究者が利用するチェックポイントを選ぶ際は、例のコードが最終モデルをそのまま実行するものと決めつけず、この不一致を確認する必要がある。Ai2は、 ScholarQA Liteのサンプルコード も案内しており、研究者はこれを自分のPDFからレポートを作る用途に応用できる。ただし、リンク先はコードであり、必要なハードウェアの最低要件を示した、すぐに使えるPDF処理一式ではない。
ローカルで試す場合の実務的な流れは、利用許諾のある論文を用意し、論文IDとともに関連箇所を抽出して選び、モデルカードの推奨形式に従って問いと参考文献を整え、選んだチェックポイントを実行し、生成されたレポートを抜粋および原論文と照らし合わせることだ。出典が説明している要素を並べた手順であり、BIG CHANGEが実行したものではない。ローカルで完全に再現するには、モデルウェイトだけでなく、検索、PDF解析、参考文献の処理、配信方法も必要になる。
文章を利用する前に根拠を確認する
まず検索過程を確認する。検索クエリと、生成モデルに渡した論文やPDFの一覧を記録する。研究が抜けていたり、関係の薄い抜粋が含まれたりすると、AstaBriefが文章を書き始める前から回答に偏りが生じる可能性がある。次に、重要な主張の根拠となる論文を開き、引用された箇所が、対象集団、方法、日付、確実性の程度も含めて、該当する文を正確に裏付けているか確認する。引用元が実在し、関連していても、一つのサンプルで得られた結果を分野全体に一般化したり、記述的な知見を助言に置き換えたりすることがある。Ai2は 発表資料で、主張の範囲が根拠を超えるこの問題を明示している。
最後に、重要なのに引用がない主張や、検索した論文の一部にレポートが繰り返し依存していないかを調べる。Ai2によると、引用の密度を基準に学習レポートを選別したことで、開発時の評価結果が向上した。この知見は出典表示が重要な理由を示すが、引用の多さだけでは、引用された主張が根拠に忠実かどうかは分からない。生成レポートは論文と照合して修正するための作業用の要約として扱う。特に、研究で引用する前や、重要な判断に使う前には確認が必要だ。
公開済みの評価で分かること
Ai2の報告によると、Astaのパイプライン全体では、ファストモードのレポート作成に平均 51.1秒 かかったのに対し、 シンキングモードでは178.5秒 かかり、この比較ではファストモードが約3.5倍速かった。モデルカードは、コンピューターサイエンス分野の質問セットScholarQA-CS2とDeepScholarBenchにおけるAstaBriefの結果を掲載している。また、発表資料には研究者3人が14個の質問を出した小規模な別の比較も記載されている。いずれもAi2自身によるシステムと評価セットの検証であり、個々のレポートの正確性を独立に実証するものではない。発表資料によると、学習と評価の大半は2025年に実施され、全評価は 現行の最先端モデルとの比較では再実施されていない。
最終 チェックポイント はApache 2.0ライセンスで公開されている。Ai2は学習データセットとプロンプトを AstaBriefコレクションに掲載している。モデルカードでは、Ai2の責任ある利用に関する指針のもと、研究と教育への利用を想定している。学習時の記録には、DPOによる調整にH100 GPUを8基使ったとあるが、これは 推論に必要な最小構成として公開されたものではない 。調査した一次資料には、ホスト版Astaのレポートごとの料金、ローカル推論に必要なGPUの最低仕様、または信頼できるレポート単価は記載されていない。導入を計画する場合は、自らの環境における費用を確認する必要がある。
出典・参考資料
- Ai2の10月2日の発表 では、ライブ版ファストモード、一度で生成する設計、処理時間、評価の制約を説明している。性能に関する主張はAi2によるもの。
- AstaBrief 8Bモデルカード には、ライセンス、想定用途、推奨プロンプト形式、推論例が記載されており、例の中でSFTチェックポイントの名称も確認できる。
- AstaBriefコレクション には公開済みのチェックポイント、データセット、プロンプトが掲載されている。それらがあるからといって、ローカルで処理全体を再現できるとは限らない。
- ScholarQAのコードとドキュメント では検索システムを説明している。 簡易版の生成コード は、再ランキングした参考文献から一度の生成でプロンプトを作る方法を示す。ドキュメントとコードを確認したが、実行はしていない。
- ScholarQA-CS2評価リポジトリ にはベンチマークのコードとデータがあり、評価基準の作り方も確認できる。テスト設計の理解には役立つが、AstaBriefの報告スコアを独立に検証したものではない。



