Ai2 於 10 月 2 日發布 AstaBrief 8B,將它作為 Asta「產生報告」功能中的 Fast 模式。可下載的模型會接收研究問題與從科學論文檢索出的摘錄,再一次生成附有引文的報告。研究人員應留意論文的來源,以及引文實際支持哪些內容:AstaBrief 根據提供的證據撰寫報告,本身並不是文獻搜尋服務。 Ai2 的發布公告與模型卡說明了這項界線。

重大變化

  • 有哪些改變:Ai2 將 AstaBrief 整合進 Asta 正式提供的 Fast 模式,並公開模型權重與訓練材料。
  • 為何重要:Ai2 表示,研究團隊可以檢視或調整報告產生器,也能在自己的基礎設施上執行開放權重模型。
  • 接下來要觀察什麼:報告品質取決於檢索到的文獻,也取決於是否逐一對照來源查核每項重要主張。由 Claude 驅動的 Asta Thinking 模式仍是另一種多步驟選項。

從問題到報告

代管版流程從 Asta 的「產生報告」功能開始,Fast 模式在此使用 AstaBrief。Ai2 表示,其報告系統會先檢索相關文獻,再將問題與摘錄交給模型。模型接著一次撰寫報告,不經 Thinking 模式使用的引文擷取、分群與逐節起草階段。公開的 ScholarQA 儲存庫說明如何從 Semantic Scholar 的段落搜尋與關鍵字搜尋取得內容,再進行重新排序;其精簡版實作會從重新排序後的參考資料組成提示詞,並呼叫設定好的生成器。這些是文件記載的元件,不是 BIG CHANGE 對 Asta 線上服務進行的測試。

至於可下載的版本,AstaBrief 模型卡建議使用其連結所提供的提示詞格式,並在輸入中納入問題與各節的參考資料。模型卡提供範例transformers/vLLM推論程式碼,最大輸出長度為 4,096 Token。卡片中的範例將model_name設為SFT 檢查點,但頁面本文介紹的是後續經 DPO 微調的AstaBrief_8B;研究人員選擇檢查點時,應先釐清這項差異,而非假設範例照原樣執行即可使用最終模型。Ai2 也連結到ScholarQA lite 範例程式碼,研究人員可以據此調整,用自有 PDF 撰寫報告。該連結目錄提供的是程式碼,並非文件完整、可直接使用且註明最低硬體需求的 PDF 解決方案。

本機實驗可採取下列實用流程:取得有權使用的論文;擷取並選出相關段落及論文識別資訊;依模型卡建議格式整理問題與參考資料;執行選定的檢查點;將生成報告與段落及原始論文並列檢視。這些是來源所記載的元件,不是 BIG CHANGE 實際執行過的步驟。完整的本機複製方案還需要檢索、PDF 解析、參考資料處理與服務部署選擇,光有模型權重並不足夠。

使用文字前先查核證據

先檢查檢索流程。記錄送交生成器的查詢,以及論文或 PDF 清單。若漏掉一項研究或納入不相關摘錄,AstaBrief 開始撰寫前答案就可能已經偏誤。接著逐篇開啟支持重要主張的引文。確認引用段落是否支持確切敘述,包括研究族群、方法、日期與確定程度。引文可能真實且相關,但報告仍可能把單一樣本的結果擴大到整個領域,或將描述性發現改寫為建議。Ai2 在其發布公告中明確指出這種主張範圍擴大的失誤。

最後,找出重要但沒有引文支持的主張,以及報告反覆依賴少量檢索論文內容的地方。Ai2 表示,從訓練報告中篩除引文密度低的案例,改善了開發結果。這項發現說明為何歸屬來源很重要,但光看引文密度無法證明主張忠實於來源。應將生成報告視為待修訂的綜合草稿,依據論文校正;研究引用或做出重大決策前尤其如此。

已發布的評估能證明什麼

Ai2 表示,整體 Asta 流程中,Fast 模式每份報告平均耗時51.1 秒,而 Thinking 模式為178.5 秒,在這項比較中約快 3.5 倍。模型卡列出 AstaBrief 在 ScholarQA-CS2 電腦科學問題與 DeepScholarBench 上的成績;發布公告另描述一項規模較小的人類比較測試,由三位研究人員提出 14 個問題。這些是 Ai2 對自家系統與測試集所做的評估,並非獨立證明任何特定報告都會準確。公告指出,多數訓練與評估工作在 2025 年進行,且完整評估並未以目前的前沿模型重新執行。

此最終檢查點以 Apache 2.0 授權公開;Ai2 也在AstaBrief 資料集中列出訓練資料集與提示詞。模型卡指出,依 Ai2 的負責任使用指引,此模型適用於研究與教育。訓練說明提到 DPO 訓練使用八張 H100 GPU;這不是已公布的推論最低硬體需求。查閱的第一手資料沒有列出代管版 Asta 每份報告的價格、本機 GPU 最低規格,或可靠的本機單份報告成本。規劃部署者必須依自己的設定確認這些費用。

來源與延伸閱讀

  • Ai2 於 10 月 2 日發布的公告說明正式提供的 Fast 模式、單次生成設計、耗時與評估限制。效能數據由 Ai2 自行提出。
  • AstaBrief 8B 模型卡列出授權、預定用途、提示詞建議與推論範例,其中範例指定了 SFT 檢查點名稱。
  • AstaBrief 資料集列出已發布的檢查點、資料集與提示詞;這些內容存在,並不代表已證明可在本機端到端重現。
  • ScholarQA 程式碼與文件說明檢索系統;精簡版生成器展示如何將重新排序的參考資料轉成單次生成提示詞。我們檢視了文件與程式碼,但未執行。
  • ScholarQA-CS2 評估儲存庫提供基準測試程式碼與資料,包括評分規準的建置方式。這有助理解測試設計,但不能獨立驗證 AstaBrief 公布的分數。