科学論文のレポート生成を高速化!オープンソース化された「AstaBrief 8B」とは

科学論文向けレポート生成モデル「AstaBrief 8B」がオープンソース化
科学研究に特化したエージェントプラットフォーム「Asta」を開発するAi2Commsが、高速レポート生成モデル「AstaBrief 8B」とその学習データをオープンソース化しました。このモデルは、研究者の質問と関連する文献の抜粋から、引用付きのレポートを生成することを目的としています。
AstaBrief 8Bは、Astaの「レポート生成」機能において、既存のClaudeベースの「Thinkingモード」と並び、「Fastモード」として提供されています。オープンソース化により、研究機関は自社のインフラでAstaBriefを実行できるようになり、機密性の高い研究や未発表の研究に関する質問にも対応可能になります。
AstaBrief 8Bで何が変わるのか?
AstaBrief 8Bの導入により、レポート生成時間が大幅に短縮されます。Ai2Commsの追跡によると、Astaパイプライン全体でFastモードはレポートあたり平均51.1秒で、Thinkingモードの178.5秒と比較して約3.5倍高速です。これは、独自モデルと比較してレポート生成時間を約1桁削減することに成功したことを示しています。
また、AstaBriefは、研究者がダウンロードして自身で実行できるモデルとして提供されるため、より柔軟な利用が可能になります。モデルの重みと合わせて、研究者が自身のPDFからレポートを作成するためのワークフロー例も公開されており、ローカルでのレポート生成の出発点となります。
AstaBrief 8Bのトレーニング方法
AstaBrief 8Bは、Qwen3-8Bをベースに、科学的な長文合成に最も重要な品質(回答の質、関連性、構造、引用の根拠)に焦点を当てて開発されました。特に、後処理データ、評価、およびレポート生成の足場に多くの労力が費やされました。
トレーニングには、実際の研究者のクエリから収集された数万件のデータが使用されました。SFT(教師ありファインチューニング)データ収集では、Astaのレポート生成の基盤となるScholarQAパイプラインを通じて、関連文献の取得、セクションへの整理、そして引用付きレポートの合成が行われました。このプロセスには、Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini、GPT-4.1といった複数の独自システムが活用され、品質フィルタリング後、47Kの利用可能なトレーニング例が得られました。
DPO(直接選好最適化)ペアの作成には、SFTデータ生成とは別のクエリサブセットが使用されました。ScholarQAパイプラインによるレポートと、o3、o4-mini、DeepSeek-V3、DeepSeek-R1などの異なるモデルで生成されたレポートを比較し、GPT-4.1とDeepSeek-R1の2つのジャッジモデルが勝者を選択しました。LLMジャッジが人間の選好と95%の一致を示し、両ジャッジが同意したペアのみが採用され、約6KのDPOデータセットが構築されました。
AstaBriefの評価は、SQABench-CS2という200件のユーザー作成のコンピュータサイエンス研究質問セットを主なターゲットとして行われました。評価指標として、レポートが必要なコンテンツをどれだけカバーしているかを測る「Rubric score」、各段落が質問に関連しているかを測る「Answer precision」、各引用が主張を裏付けているかを測る「Citation precision」、レポートの主張が引用によって完全に裏付けられているかを測る「Citation recall」の4つが追跡されました。


