HN 日本語サマリー

← 一覧へ戻る
科学・技術

Astaにおける高速レポート生成モデルAstaBriefのオープンソース化

Open-sourcing AstaBrief, the fast report-generation model in Asta (allenai.org)

26 pointsby malshe3 コメント

要約

Allen Institute for AI (Ai2) は、科学論文のレポート生成を高速化するモデル「AstaBrief」をオープンソース化しました。AstaBriefは、研究クエリと関連文献抜粋から引用付きレポートを生成し、既存のプロプライエタリモデルと比較して生成時間を約10分の1に短縮します。このモデルは、科学研究の特定の要求に応えるためのオープンな言語モデル構築という、より広範な目標の一環です。

全文翻訳

Astaにおける高速レポート生成モデルAstaBriefのオープンソース化 2026年10月2日 Ai2 共有 言語モデルはすでに、研究者が文献を検索し、証拠を合成し、複雑な質問に取り組むのを助けることができます。しかし、科学的な作業はこれらのモデルに特別な要求を課します。回答は証拠に基づいている必要があり、モデルは研究の結論を静かに広げるのではなく、証拠が実際に何を支持しているかを維持する必要があります。そして、研究者は最終的な出力を検証できる必要があります。 これは、科学者がAsta、つまり科学的作業のためのエージェントプラットフォームをどのように使用するかにも表れています。単純なキーワード検索ではなく、ユーザーはしばしばかなりのコンテキストと多くの制約を持ち込みます。例えば、Astaに特定のメソッド、集団、または設定を考慮しながら、文献群全体のアプローチを比較するように依頼します。また、生成されたレポートを単発の回答としてではなく、作業中の研究成果物として扱い、後で参照するユーザーも多くいます。 私たちは、科学者が引用付きレポートをより速く生成できるよう支援したいと考えました。それは、彼らが自分でダウンロードして実行できるモデルで実現することです。そのため、科学レポート生成に特化してトレーニングされた小型のオープンモデルが、私たちが使用していたプロプライエタリモデルのレポート品質に匹敵しつつ、生成時間を短縮し、サービスコストを削減できるかどうかをテストしました。私たちは、研究クエリと取得された文献抜粋を引用付きレポートに変換するモデル、AstaBrief 8Bを構築しました。AstaBriefは現在、Astaの「レポートを生成する」機能でClaude搭載の「Thinkingモード」と並んで「Fastモード」として利用可能であり、また、他の人が私たちのアプローチを研究、再現、構築できるように、モデルとトレーニングデータをオープンソース化しています。 AstaBriefの開発には、数万件の実際の研究クエリ、引用に焦点を当てたフィルタリング、選好データ、そしてセクションごとにレポートを作成するのではなく、一度にレポート全体を書き上げる再設計されたレポート生成パイプラインが必要でした。その結果、追跡したプロプライエタリモデルと比較して、レポート生成時間がほぼ1桁短縮されました。Asta全体のパイプラインでは、「Fastモード」はレポートあたり平均51.1秒であるのに対し、「Thinkingモード」は178.5秒で、約3.5倍高速です。これらの効率的な改善は、AstaBriefを、科学的作業の特定の要求に適応できるオープン言語モデルを構築するという、より広範な目標のための有用なテストケースとしました。オープンウェイトは、研究機関がAstaBriefを独自のインフラストラクチャで実行することも可能にします。これは、研究クエリが機密性の高い、または未公開の研究を明らかにする場合に必要です。モデルウェイトと並行して、研究者が独自のPDFからレポートを作成するために適応できるサンプルワークフローをリリースしており、ローカルレポート生成の出発点を提供します。 この記事では、AstaBriefのトレーニング方法、科学的証拠にそれを根拠づけることについて学んだこと、そして私たちのどのアプローチが将来の科学用モデルに引き継げるかをカバーします。説明されているトレーニングと評価のほとんどは2025年に完了したため、トレーニングデータを生成するために使用されたプロプライエタリモデルおよび比較対象は、当時の最先端を反映しています。今日の最先端モデルに対して完全な評価を再実行していません。以下の結果は、私たちがテストした特定のトレーニングとシステム設計の選択に関する証拠として読むのが最善です。 モデルのトレーニング AstaBriefの目標は、長文の科学的合成において最も重要なすべての品質、つまり回答の質、関連性、構造、および引用の根拠を持つオープンウェイトモデルを構築することでした。私たちはQwen3-8Bから開始し、トレーニング後のデータ、評価、および周囲のレポート生成の足場にほとんどの労力を集中しました。 一般的なモデルを科学的作業に適応させること、および新しい科学モデルをゼロからトレーニングすることは、Ai2全体で私たちが広く探求していることです。NSF OMAI(Ai2が主導する科学的発見のための完全にオープンなAIインフラストラクチャとモデルを構築するための米国国家イニシアチブ)を通じて、私たちの研究者は、将来のオープンモデルに科学コミュニティが何を必要としているか、そして今日の一般的なモデルがどこで不足しているかを理解するために、科学コミュニティと直接協力しています。これには、科学分野やワークフローごとにニーズがどのように異なるかを研究することが含まれており、その研究からのさらなる発見は将来共有される予定です。 最近のDR Tuluなどの研究では、特にトレーニングループにジャッジモデルが関与する場合、強化学習ベース(RL)の方法がオープンウェイトモデルの長文レポート生成を改善できることが示されています。私たちはAstaBriefでそのパスを検討しましたが、最終的には教師ありファインチューニング(SFT)と直接選好最適化(DPO)を中心とした、よりシンプルなレシピに焦点を当てました。 RLベースのトレーニングは不安定で高価になる可能性があります。私たちは、より安価で運用管理が容易なセットアップで、レポート生成の品質をどこまで押し上げられるかを確認したかったのです。これはデバッグやイテレーションも容易です。 そのため、トレーニングデータの品質が特に重要になりました。ノイズの多い例を補うために、より複雑な最適化方法に頼るのではなく、プロジェクトの大部分を、私たちが望むレポート作成行動を実際に実証する例を生成、選択、フィルタリングする方法を見つけることに費やしました。また、AstaBriefをより高速にしたいと考えました。これにより、ユーザーは迅速に予備的なレポートを取得し、後続のターンでそれをイテレートできるようになります。速度向上のために、AstaBriefがユーザーのクエリと関連する取得済みスニペットを与えられて、最終レポートを一度に直接生成するようにトレーニングすることを決定しました。これにより、AstaのClaudeベースのThinkingモードが使用する高価なスニペット要約およびクラスタリングステージをバイパスし、回答セクションごとに書き出すことを回避しました。興味深いことに、パフォーマンスを犠牲にすることなくそれが可能であることがわかりました。 SFTトレーニングデータの収集 トレーニングパイプラインは、私たちの論文「Synthesizing scientific literature with retrieval-augmented LMs」およびAstaのレポート生成機能を現在支えているフレームワークであるScholarQAで説明されているシステムを通じて送信された実際のユーザークエリから始まりました。合成プロンプトやベンチマークスタイルのタスクのみでトレーニングするのではなく、AstaBriefに実際の科学者からの実際のクエリから学習させたいと考えました。 私たちの研究は、科学者が言語モデルに求めるものが、一般的なチャットボットや従来の検索ツールにユーザーが求めるものとは異なることが多いことを示唆しています。数万件のAstaクエリの分析では、専門の研究者は、短くキーワードスタイルのプロンプトに頼るのではなく、しばしばかなりのコンテキスト、複数の制約、および概念間の関係を提供しました。 より最近のAstaユーザー調査でも、研究者がAIを自分の仕事にどのように関与させたいかについての違いが明らかになっています。一部のユーザーは、アイデア出しや実験にモデルを使用することに抵抗がありませんが、他のユーザーは、合成、文献監視、またはパターン発見におけるより狭い役割を好みます。これらの違い全体を通して、参加者はより明確なソースの追跡可能性、モデルが何をしているかのより多くの可視性、そしてそれが使用するコンテキストに対するより大きな制御を望んでいます。 収集したユーザーログを品質、関連性、プライバシーのためにフィルタリングし、ベータテスターとボットのトラフィックを削除し、意味のあるものにするには短すぎるクエリをドロップし、LLMベースのフィルタリングパスを使用して非英語クエリ、非科学的なリクエスト、および個人情報を含むプロンプトを捕捉しました。これにより、90K件の研究に焦点を当てたクエリのプールが残りました。 SFTのために、Astaのレポート生成の背後にあるマルチステップScholarQAパイプラインを使用して、フィルタリングされたクエリから完全なレポートのターゲット出力を生成しました。パイプラインは関連する文献を取得し、資料をセクションに整理し、バックエンドのレポート生成モデルを使用して引用付きレポートに証拠を合成しました。プロプライエタリシステムを組み合わせて使用しました:Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini、およびGPT-4.1。品質フィルタリング後、これにより47K件の有用なトレーニング例が得られました。 DPOペアの作成 DPOには異なる種類のトレーニングデータが必要でした。クエリごとに単一のターゲットレポートの代わりに、一方のレポートが他方よりも好ましいペアが必要でした。 SFTデータ生成中に使用されなかったクエリの別のサブセットからこれらのペアを作成しました。クエリごとの1つのレポートは、